Una foto parlante es un MP4 corto en el que una fotografía fija parece hablar al ritmo de una voz que ya tienes. Subes una foto y un archivo de audio. El generador estima el movimiento de la boca a partir de esa pista y escribe fotogramas nuevos. La imagen no se reproduce simplemente con el audio encima. El movimiento genérico de imagen a vídeo, que inventa recorridos de cámara o clima a partir de un prompt, es otro trabajo.
La entrada útil es una fotografía con un rostro claro, bien iluminado y sin recortar por la boca. Las gafas de sol, una oclusión fuerte, un perfil extremo o un rostro minúsculo en una muchedumbre dificultan la sincronización labial. Eso es una pista de calidad, no un bloqueo técnico. El área de trabajo aceptará un archivo que cumpla el tamaño y el tipo. El resultado sigue siendo probabilístico. Los dientes, la lengua y el borde de los labios pueden desviarse. La identidad alrededor de la mandíbula puede suavizarse. Una segunda persona en el encuadre puede recoger movimiento residual. Revisa la descarga antes de publicarla.
Banana Pro AI cobra según la duración de audio que el servidor mide en la subida, no según los segundos que muestra el reproductor del navegador. 32 créditos por segundo a 720 y 48 créditos por segundo a 1080. La longitud facturada va de un segundo a 60 menos uno. Las pistas de 60 segundos o más se rechazan. Un MP3 de bitrate variable sin metadatos de duración legibles puede fallar aunque la previsualización se oiga bien. El texto de pista opcional admite hasta 300 caracteres. La v1 no añade texto a voz, clon de voz, semilla ni máscara.