Una foto parlante è un breve MP4 in cui una fotografia fissa sembra parlare a ritmo di una voce che hai già. Carichi una foto e un file audio. Il generatore stima il movimento della bocca da quella traccia e scrive nuovi fotogrammi. La foto non viene semplicemente riprodotta con l'audio sopra. Il movimento generico da immagine a video, che inventa movimenti di camera o meteo da un prompt, è un altro lavoro.
L'input utile è una fotografia in cui il volto è nitido, ben illuminato e non tagliato sulla bocca. Occhiali da sole, occlusioni forti, profilo estremo o un volto minuscolo in mezzo alla folla rendono la sincronizzazione labiale più difficile. È un indizio di qualità, non un blocco tecnico. Il banco di lavoro accetterà comunque un file che rispetta le regole di dimensione e tipo. Il risultato resta probabilistico. Denti, lingua e bordi delle labbra possono spostarsi. L'identità intorno alla mascella può ammorbidirsi. Una seconda persona nell'inquadratura può raccogliere movimento residuo. Controlla il download prima di pubblicarlo.
Banana Pro AI addebita in base alla durata audio misurata dal server al caricamento, non ai secondi mostrati dal lettore del browser. 32 crediti al secondo a 720 e 48 crediti al secondo a 1080. La durata addebitata va da un secondo a 60 meno uno. Le tracce da 60 secondi o più vengono rifiutate. Un MP3 a bitrate variabile senza metadati di durata leggibili può fallire anche se l'anteprima sembra corretta. Il testo di suggerimento facoltativo può arrivare a 300 caratteri. La v1 non aggiunge sintesi vocale, clonazione della voce, seed o maschera.