Une photo parlante est un court MP4 dans lequel une photographie fixe semble parler au rythme d'une voix que vous possédez déjà. Vous importez une photo et un fichier audio. Le générateur estime le mouvement de la bouche à partir de cette piste et écrit de nouvelles images. La photo n'est pas simplement lue avec l'audio par-dessus. Le mouvement générique image-vers-vidéo, qui invente un travelling ou de la météo à partir d'un prompt, est un autre travail.
L'entrée utile est une photographie où le visage est net, bien éclairé et non coupé au niveau de la bouche. Les lunettes de soleil, une occlusion forte, un profil extrême ou un visage minuscule dans une foule rendent la synchronisation labiale plus difficile. C'est un indice de qualité, pas un verrou technique. L'atelier acceptera quand même un fichier conforme aux règles de taille et de type. Le résultat reste probabiliste. Les dents, la langue et le bord des lèvres peuvent dériver. L'identité autour de la mâchoire peut s'adoucir. Une deuxième personne dans le cadre peut capter un mouvement résiduel. Inspectez le téléchargement avant de le publier.
Banana Pro AI facture selon la durée audio mesurée par le serveur à l'import, pas selon les secondes affichées par le lecteur du navigateur. 32 crédits par seconde en 720 et 48 crédits par seconde en 1080. La durée facturée va d'une seconde à 60 moins une. Les pistes de 60 secondes ou plus sont refusées. Un MP3 à débit variable sans métadonnées de durée lisibles peut échouer même si l'aperçu semble correct. Le texte d'indice facultatif peut aller jusqu'à 300 caractères. La v1 n'ajoute ni synthèse vocale, ni clonage de voix, ni graine, ni masque.