Ein sprechendes Foto ist ein kurzes MP4, in dem ein Standbild scheinbar mit einer Stimme spricht, die du bereits hast. Du lädst ein Foto und eine Audiodatei hoch. Der Generator schätzt aus dieser Spur die Mundbewegung und schreibt neue Videobilder. Das Standbild wird nicht einfach mit daruntergelegtem Ton abgespielt. Die allgemeine Bild-zu-Video-Bewegung, die aus einem Prompt eine Kamerafahrt oder Wetter erfindet, ist eine andere Aufgabe.
Die brauchbare Eingabe ist ein Foto, auf dem ein Gesicht klar sichtbar und gut beleuchtet ist und der Mund nicht abgeschnitten wird. Sonnenbrillen, starke Verdeckung, extremes Profil oder ein winziges Gesicht in einer Menschenmenge erschweren die Lippensynchronisation. Das ist ein Qualitätshinweis, keine harte Sperre. Der Arbeitsbereich akzeptiert trotzdem eine Datei, die Größen- und Formatregeln erfüllt. Ergebnisse bleiben probabilistisch. Zähne, Zunge und Lippenränder können abweichen. Die Identität rund um den Kiefer kann weicher werden. Eine zweite Person im Bild kann Restbewegung aufnehmen. Prüfe den Download, bevor du ihn veröffentlichst.
Banana Pro AI rechnet nach der Audiodauer ab, die der Server beim Upload misst, nicht nach den Sekunden, die ein Browser-Player anzeigt. 32 Credits pro Sekunde bei 720 und 48 Credits pro Sekunde bei 1080. Die abgerechnete Länge reicht von einer Sekunde bis 60 minus eins. Spuren ab 60 Sekunden werden abgelehnt. Eine MP3 mit variabler Bitrate ohne lesbare Dauer-Metadaten kann fehlschlagen, obwohl die Vorschau gut klingt. Der optionale Hinweistext darf bis zu 300 Zeichen lang sein. v1 bietet kein Text-to-Speech, keinen Stimmklon, keinen Seed und keine Maske.