O fotografie vorbitoare este un MP4 scurt în care o fotografie statică pare să vorbească în ritmul unei voci pe care o ai deja. Încarci o fotografie și un fișier audio. Generatorul estimează mișcarea gurii din acea pistă și scrie cadre video noi. Fotografia nu este redată pur și simplu cu audio deasupra. Mișcarea generică imagine-în-video, care inventează o mișcare de cameră sau vreme dintr-un prompt, este o altă sarcină.
Intrarea utilă este o fotografie în care fața este clară, bine luminată și nu este tăiată prin gură. Ochelarii de soare, ocluzia puternică, profilul extrem sau o față minusculă într-o mulțime fac sincronizarea labială mai grea. Acesta este un indiciu de calitate, nu o barieră dură. Spațiul de lucru va accepta totuși un fișier care respectă regulile de dimensiune și tip. Rezultatul rămâne probabilistic. Dinții, limba și marginile buzelor pot deriva. Identitatea din jurul maxilarului se poate înmuia. O a doua persoană din cadru poate prelua mișcare rămasă. Verifică descărcarea înainte de a o publica.
Banana Pro AI taxează după durata audio măsurată de server la încărcare, nu după secundele afișate de playerul din browser. 32 credite pe secundă la 720 și 48 credite pe secundă la 1080. Durata taxată merge de la o secundă până la 60 minus unu. Piesele de 60 secunde sau mai mult sunt respinse. Un MP3 cu bitrate variabil fără metadate de durată lizibile poate eșua chiar dacă previzualizarea sună bine. Textul de indiciu opțional poate avea până la 300 caractere. v1 nu adaugă sinteză vocală, clonare vocală, seed sau mască.