Mówiące zdjęcie to krótkie MP4, w którym nieruchome zdjęcie wygląda, jakby mówiło w rytm głosu, który już masz. Wgrywasz jedno zdjęcie i jeden plik audio. Generator szacuje ruch ust na podstawie tej ścieżki i zapisuje nowe klatki wideo. Zdjęcie nie jest po prostu odtwarzane z dźwiękiem na wierzchu. Ogólny ruch obrazu do wideo, który wymyśla przesunięcie kamery albo pogodę z promptu, to inne zadanie.
Przydatnym wejściem jest fotografia, na której twarz jest wyraźna, dobrze oświetlona i nieprzecięta przez usta. Okulary przeciwsłoneczne, silne zasłonięcie, skrajny profil albo maleńka twarz w tłumie utrudniają synchronizację ust. To wskazówka jakościowa, nie twarda blokada. Obszar roboczy i tak przyjmie plik spełniający zasady rozmiaru i typu. Wynik pozostaje probabilistyczny. Zęby, język i krawędzie warg mogą się przesunąć. Tożsamość wokół szczęki może się złagodzić. Druga osoba w kadrze może przejąć resztkowy ruch. Sprawdź pobrany plik, zanim go opublikujesz.
Banana Pro AI rozlicza według długości audio zmierzonej przez serwer przy wgrywaniu, a nie według sekund pokazywanych przez odtwarzacz w przeglądarce. 32 kredytów na sekundę przy 720 i 48 kredytów na sekundę przy 1080. Rozliczana długość wynosi od jednej sekundy do 60 minus jeden. Ścieżki od 60 sekund wzwyż są odrzucane. MP3 o zmiennym bitrate bez czytelnych metadanych długości może zawieść, nawet gdy podgląd brzmi dobrze. Opcjonalny tekst podpowiedzi może mieć do 300 znaków. v1 nie dodaje syntezy mowy, klonowania głosu, ziarna ani maski.