Ett talande foto är en kort MP4 där ett stillbildsfoto ser ut att tala i takt med en röst du redan har. Du laddar upp ett foto och en ljudfil. Generatorn uppskattar munrörelsen från spåret och skriver nya videorutor. Fotot spelas inte bara upp med ljudet ovanpå. Den allmänna bild-till-video-rörelsen, som hittar på kamerafärd eller väder från en prompt, är en annan uppgift.
Den användbara ingången är ett foto där ansiktet syns tydligt, är väl upplyst och inte skärs av över munnen. Solglasögon, kraftig ocklusion, extrem profil eller ett litet ansikte i en folksamling gör läppsynken svårare. Det är en kvalitetstips, inte en hård spärr. Arbetsytan tar ändå emot en fil som följer reglerna för storlek och typ. Resultatet är fortfarande sannolikhetsbaserat. Tänder, tunga och läppkanter kan glida. Identiteten kring käken kan mjukna. En andra person i bilden kan få kvarvarande rörelse. Granska nedladdningen innan du publicerar.
Banana Pro AI debiterar efter ljudlängden som servern mäter vid uppladdning, inte efter sekunderna som webbläsarens spelare visar. 32 krediter per sekund vid 720 och 48 krediter per sekund vid 1080. Den debiterade längden går från en sekund till 60 minus ett. Spår på 60 sekunder eller mer avvisas. En MP3 med variabel bitrate utan läsbara längdmetadata kan misslyckas även när förhandsvisningen låter bra. Den valfria tipstexten kan vara upp till 300 tecken. v1 lägger inte till text-till-tal, röstkloning, seed eller mask.