SINCRONIZACIÓN LABIAL POR AUDIO

Foto parlante con IA

Sube una foto con un rostro visible y una pista de audio que grabaste o de la que eres titular. La herramienta crea un MP4 de sincronización labial a partir de ese par. No es una superposición de still más audio ni un movimiento genérico de imagen a vídeo.

Foto · obligatoria(0/1)

Audio · obligatorio

Un rostro claramente visible en el still da más margen a la sincronización labial. Es una guía, no un bloqueo técnico. Inicia sesión antes de subir.

0 / 300
Resolución
Se necesita una cuenta32 créditos/s a 720 · 48 créditos/s a 1080
PrevisualizaciónListo

Añade una foto y una pista de audio

Usa un still con un rostro visible y una pista subida limpia. El MP4 generado sustituye esta previsualización cuando esté listo.

32 créditos/s a 720 · 48 créditos/s a 1080 · cobrado según los segundos de audio medidos
Abrir Mis creaciones
Respuesta directa

¿Qué es una foto parlante con IA?

Una foto parlante es un MP4 corto en el que una fotografía fija parece hablar al ritmo de una voz que ya tienes. Subes una foto y un archivo de audio. El generador estima el movimiento de la boca a partir de esa pista y escribe fotogramas nuevos. La imagen no se reproduce simplemente con el audio encima. El movimiento genérico de imagen a vídeo, que inventa recorridos de cámara o clima a partir de un prompt, es otro trabajo.

La entrada útil es una fotografía con un rostro claro, bien iluminado y sin recortar por la boca. Las gafas de sol, una oclusión fuerte, un perfil extremo o un rostro minúsculo en una muchedumbre dificultan la sincronización labial. Eso es una pista de calidad, no un bloqueo técnico. El área de trabajo aceptará un archivo que cumpla el tamaño y el tipo. El resultado sigue siendo probabilístico. Los dientes, la lengua y el borde de los labios pueden desviarse. La identidad alrededor de la mandíbula puede suavizarse. Una segunda persona en el encuadre puede recoger movimiento residual. Revisa la descarga antes de publicarla.

Banana Pro AI cobra según la duración de audio que el servidor mide en la subida, no según los segundos que muestra el reproductor del navegador. 32 créditos por segundo a 720 y 48 créditos por segundo a 1080. La longitud facturada va de un segundo a 60 menos uno. Las pistas de 60 segundos o más se rechazan. Un MP3 de bitrate variable sin metadatos de duración legibles puede fallar aunque la previsualización se oiga bien. El texto de pista opcional admite hasta 300 caracteres. La v1 no añade texto a voz, clon de voz, semilla ni máscara.

Fotogramas de origen para encargos comerciales

Tres fotogramas de origen, no salidas generadas

Estos encuadres son fotogramas de origen y pósters fijos para un encargo de foto parlante. No son clips de sincronización labial generados ni grabaciones en directo. Sirven para juzgar si tu propia imagen es un tipo de entrada parecido.

Póster de origen de un fundador con un producto, usado como entrada de foto parlante, no como clip generado
Fotograma de origen
Póster fijo

Pitch de producto desde un retrato de fundador

Un still de catálogo o landing de una persona con un producto, grabado después como pitch hablado. Este flujo sirve para un rostro que ya está en la fotografía más una pista que grabaste en una sala silenciosa. Mantén la etiqueta del producto legible. No esperes que el generador invente otro ángulo de cámara ni un segundo par de manos.

Póster de origen de un retrato formal previsto como entrada de foto parlante, no como vídeo conmemorativo en directo
Fotograma de origen
Póster fijo

Saludo conmemorativo desde un retrato familiar

Un retrato formal usado con un saludo corto que grabaste tú. Una foto parlante puede llevar una voz recordada a una imagen que tienes derecho a usar. No puede restaurar a alguien que no está en la fotografía ni promete coincidir con cada recuerdo familiar. Mantén la subida lícita. Confirma los derechos antes de gastar créditos.

Póster de origen de un presentador de frente, usado como entrada de foto parlante y no como vídeo explicativo terminado
Fotograma de origen
Póster fijo

Explicación desde un still de presentador

Un still de presentador para un curso, una FAQ o un clip de soporte. La salida debe conservar la misma ropa y el mismo fondo mientras la boca sigue tu pista. Si necesitas otra sala, un plano andando o un corte entre diapositivas, usa imagen a vídeo o una sesión filmada en lugar de esta área de trabajo.

Un flujo práctico

Cómo crear una foto parlante con foto y audio

Prepara primero el still y la pista. Los créditos se cotizan solo cuando el servidor mide el audio. La generación es una tarea seguida que puedes reabrir desde Mis creaciones.

1. Sube un still con un rostro visible

Elige un JPG, PNG o WebP de hasta 10 MB, con cada lado de al menos 256 píxeles. Un rostro que ocupe una parte razonable del encuadre, mirando a cámara, es el punto de partida honesto. Recorta antes de subir si el sujeto es minúsculo.

2. Sube la pista que debe mover la boca

Sube MP3, WAV, AAC, OGG o M4A de hasta 10 MB. Prefiere un solo hablante y un archivo legible. El servidor devuelve los segundos facturados. El reproductor de la página es solo una previsualización. Aparece un aviso cuando la longitud medida supera 15 segundos. El rechazo duro es 60 segundos o más.

3. Elige 720 o 1080 y confirma los derechos

La salida por defecto es 1080 a 48 créditos por segundo facturado. 720 cuesta 32 créditos por segundo facturado. Confirma que eres titular de la foto y del audio, o que tienes permiso para usarlos. El generador no añadirá una segunda voz ni clonará una voz a partir de un prompt.

4. Genera el MP4 de sincronización labial

Inicia sesión, gasta los créditos cotizados y espera. Las comprobaciones de estado se ejecutan cada pocos segundos y se pausan a los quince minutos. El mismo id de solicitud puede reanudarse sin un segundo cargo. Si la tarea falla, los créditos reservados vuelven. Reintentar desde Mis creaciones restaura solo la pista y la resolución. Debes volver a subir la foto y el audio.

5. Revisa la sincronización de la boca y descarga

Mira el clip entero. Comprueba el primer y el último fonema, los dientes y si se movió un segundo rostro. Descarga desde Mis creaciones. Trata el archivo como borrador hasta haberlo visto. Una foto parlante no sustituye una entrevista filmada cuando importa la exactitud legal o de archivo.

Elige el camino de vídeo adecuado

Foto parlante, avatar parlante, imagen a vídeo y rodaje tradicional

Elige el camino que coincide con los activos que ya tienes. Una foto parlante necesita un still y una pista subida. Un avatar parlante es un personaje persistente. Imagen a vídeo es movimiento a partir de un still. El rodaje tradicional captura una interpretación real en una línea de tiempo.

Foto parlante, avatar parlante, imagen a vídeo y rodaje tradicional
Foto parlante, avatar parlante, imagen a vídeo y rodaje tradicionalIdeal paraControlContrapartida
Foto parlanteUna fotografía real de una persona más una pista grabada que puedas subirTú eliges el still, el archivo de audio y 720 o 1080. La duración sale de la pistaLa sincronización labial puede desviarse. Sin texto a voz, sin clon de voz, sin un movimiento extra de cámara más allá de lo que el modelo inventa alrededor de la boca
Avatar parlanteUn presentador digital reutilizable que debe aparecer en muchos guionesLa configuración del personaje y las tomas posteriores comparten una identidad que mantienes en el tiempoNo estás fijando la salida a una fotografía existente. Las páginas de avatar son otro producto
Imagen a vídeoUn still que debe ganar movimiento de cámara, clima u una órbita lenta de producto a partir de un prompt escritoFotograma inicial, fotograma final opcional, duración y un prompt de movimientoLa boca no la mueve tu audio. No lo uses cuando el encargo es una foto parlante
Rodaje tradicionalEntrevistas, declaraciones legales y cualquier toma en la que la interpretación real deba existir en una tarjeta de cámaraIluminación, ópticas, repeticiones y un editor en una línea de tiempo localLa máxima fidelidad y el mayor coste de producción. Ningún modelo sustituye un rodaje que aún necesitas

Lo que esta herramienta no promete

La salida es un MP4 de sincronización labial generado. No es una grabación recuperada del día en que se tomó el still. No es una superposición sin pérdidas del audio sobre el JPEG. Si el rostro es pequeño, de lado o cubierto, la calidad de sincronización suele bajar. Si el audio es ruidoso, recortado o lleno de voces superpuestas, el movimiento de la boca lo mostrará. Los créditos se cobran según los segundos de audio medidos en el servidor. La duración de la previsualización del navegador no es la factura.

La v1 exige un archivo de audio subido por el usuario. No hay cuadro de texto a voz, ni clon de voz a partir de una muestra, ni un deslizador de duración al generar. Las pistas de 60 segundos o más se rechazan. Una longitud por encima de 15 segundos se permite bajo ese tope y puede verse menos estable. Los archivos MP3 de bitrate variable sin metadatos de duración legibles pueden rechazarse aunque se reproduzcan en la previsualización.

Límites y almacenamiento

Una ejecución con sesión crea una tarea seguida. Puedes reabrir el resultado desde Mis creaciones tras una conexión caída sin otro cargo para ese id de solicitud. El almacenamiento actual no tiene caducidad automática para los objetos subidos o generados. Eliminar en Mis creaciones hace un borrado suave del registro de la tarea en el historial de la cuenta. No borra el objeto subyacente ni una copia del proveedor. Revisa la Política de privacidad y las Condiciones del servicio antes de subir rostros sensibles o habla privada.

Mis creaciones · Política de privacidad · Condiciones del servicio

Oficina de Derechos de Autor de EE. UU., Copyright and Artificial IntelligenceMaterial público sobre cuestiones de derechos de autor e inteligencia artificial. No es asesoramiento jurídico.

Herramientas de vídeo relacionadas

Otros caminos de vídeo de Banana Pro AI

Quédate en esta página cuando tengas un still y una pista subida. Usa las herramientas relacionadas cuando el encargo sea movimiento a partir de un still, un generador de vídeo más amplio o una identidad de avatar.

Preguntas

Preguntas frecuentes

Respuestas directas sobre sincronización labial guiada por audio, créditos, límites de duración y lo que esta página no hace.

¿Qué genera una foto parlante con IA?

Un MP4 de sincronización labial a partir de una foto fija y una pista de audio subida. La boca la mueve esa pista. El still no se reproduce como una presentación de diapositivas con sonido encima.

¿Necesito foto y audio?

Sí en la v1. El área de trabajo exige una foto y un archivo MP3, WAV, AAC, OGG o M4A subido por el usuario. No hay campo de texto a voz ni clon de voz.

¿Cómo se cobran los créditos?

Según los segundos facturados que el servidor mide al subir el audio. 32 créditos por segundo a 720. 48 créditos por segundo a 1080. La resolución por defecto es 1080. La duración del reproductor es solo una previsualización.

¿De cuánto puede ser el audio?

Más corto que 60 segundos. Aparece un aviso por encima de 15 segundos. 60 segundos o más se rechaza. Los archivos de más de 10 MB se rechazan. Un MP3 VBR sin metadatos de duración legibles puede fallar.

¿El rostro tiene que verse?

Un rostro visible se recomienda con fuerza. No es un bloqueo técnico. Los rostros ocluidos o minúsculos suelen producir una sincronización labial más débil. Revisa el resultado.

¿Es lo mismo que imagen a vídeo?

No. Imagen a vídeo inventa movimiento a partir de un prompt. Una foto parlante fija la interpretación a tu audio subido. Usa imagen a vídeo cuando quieras recorrido de cámara sin una pista de voz.

Genera una foto parlante con un still y una pista

Sube una foto que puedas usar, sube el audio, elige 720 o 1080 y revisa el MP4 de sincronización labial antes de compartirlo.

Abrir el área de trabajo