SYNCHRONISATION LABIALE PILOTÉE PAR L'AUDIO

Photo parlante IA

Importez une photo avec un visage visible et une piste audio que vous avez enregistrée ou que vous possédez. L'outil crée un MP4 synchronisé à partir de ce couple. Ce n'est pas une superposition photo plus audio, ni un mouvement générique image-vers-vidéo.

Photo · obligatoire(0/1)

Audio · obligatoire

Un visage clairement visible sur la photo améliore la synchronisation labiale. C'est un conseil, pas un verrou technique. Connectez-vous avant d'importer.

0 / 300
Résolution
Compte requis32 crédits/s en 720 · 48 crédits/s en 1080
AperçuPrêt

Ajoutez une photo et une piste audio

Utilisez une photo avec un visage visible et une piste importée propre. Le MP4 généré remplace cet aperçu dès qu'il est prêt.

32 crédits/s en 720 · 48 crédits/s en 1080 · facturé selon les secondes audio mesurées
Ouvrir Mes créations
Réponse directe

Qu'est-ce qu'une photo parlante IA ?

Une photo parlante est un court MP4 dans lequel une photographie fixe semble parler au rythme d'une voix que vous possédez déjà. Vous importez une photo et un fichier audio. Le générateur estime le mouvement de la bouche à partir de cette piste et écrit de nouvelles images. La photo n'est pas simplement lue avec l'audio par-dessus. Le mouvement générique image-vers-vidéo, qui invente un travelling ou de la météo à partir d'un prompt, est un autre travail.

L'entrée utile est une photographie où le visage est net, bien éclairé et non coupé au niveau de la bouche. Les lunettes de soleil, une occlusion forte, un profil extrême ou un visage minuscule dans une foule rendent la synchronisation labiale plus difficile. C'est un indice de qualité, pas un verrou technique. L'atelier acceptera quand même un fichier conforme aux règles de taille et de type. Le résultat reste probabiliste. Les dents, la langue et le bord des lèvres peuvent dériver. L'identité autour de la mâchoire peut s'adoucir. Une deuxième personne dans le cadre peut capter un mouvement résiduel. Inspectez le téléchargement avant de le publier.

Banana Pro AI facture selon la durée audio mesurée par le serveur à l'import, pas selon les secondes affichées par le lecteur du navigateur. 32 crédits par seconde en 720 et 48 crédits par seconde en 1080. La durée facturée va d'une seconde à 60 moins une. Les pistes de 60 secondes ou plus sont refusées. Un MP3 à débit variable sans métadonnées de durée lisibles peut échouer même si l'aperçu semble correct. Le texte d'indice facultatif peut aller jusqu'à 300 caractères. La v1 n'ajoute ni synthèse vocale, ni clonage de voix, ni graine, ni masque.

Photos sources pour des projets commerciaux de photo parlante

Trois affiches sources, pas de résultat généré

Ces images sont des sources et des affiches fixes pour un brief de photo parlante. Ce ne sont pas des clips de synchronisation labiale générés ni des enregistrements live. Utilisez-les pour juger si votre propre photo est une entrée du même type.

Affiche source d'un fondateur tenant un produit, utilisée comme entrée de photo parlante et non comme clip généré
Photo source
Affiche fixe

Présentation produit à partir d'un portrait de fondateur

Une photo de catalogue ou de page d'atterrissage montrant une personne tenant un produit, enregistrée plus tard comme présentation parlée. La photo parlante sert à un visage déjà présent sur la photographie, plus une piste enregistrée dans une pièce calme. Gardez l'étiquette du produit lisible. N'attendez pas du générateur qu'il invente un second angle de caméra ou une nouvelle paire de mains.

Affiche source d'un portrait formel prévu comme entrée de photo parlante, et non comme vidéo commémorative en direct
Photo source
Affiche fixe

Message commémoratif à partir d'une photo de famille

Un portrait formel accompagné d'un court message que vous avez enregistré vous-même. Une photo parlante peut porter une voix mémorisée sur une photo que vous avez le droit d'utiliser. Elle ne peut pas faire revenir une personne absente de la photographie et ne promet pas une correspondance parfaite avec chaque souvenir familial. Gardez l'import légal. Vérifiez les droits avant de dépenser des crédits.

Affiche source d'un présentateur face caméra, utilisée comme entrée de photo parlante et non comme vidéo explicative terminée
Photo source
Affiche fixe

Explication à partir d'une photo de présentateur

Une photo de présentateur pour un cours, une FAQ ou un clip d'assistance. Le résultat doit conserver les mêmes vêtements et le même arrière-plan pendant que la bouche suit votre piste importée. Si vous avez besoin d'une nouvelle pièce, d'un plan en marche ou d'une coupe entre diapositives, utilisez image-vers-vidéo ou une session filmée plutôt que cet atelier.

Un flux pratique

Comment créer une photo parlante à partir d'une photo et d'un audio

Préparez d'abord la photo et la piste. Les crédits ne sont annoncés qu'après la mesure de l'audio par le serveur. La génération est une tâche suivie que vous pouvez rouvrir depuis Mes créations.

1. Importez une photo avec un visage visible

Choisissez un JPG, PNG ou WebP jusqu'à 10 Mo, chaque côté au moins 256 pixels. Un visage qui occupe une part raisonnable du cadre et regarde vers la caméra est le point de départ honnête. Recadrez avant l'import si le sujet est minuscule.

2. Importez la piste qui doit animer la bouche

Importez MP3, WAV, AAC, OGG ou M4A jusqu'à 10 Mo. Préférez un seul locuteur et un fichier bien lisible. Le serveur renvoie les secondes facturées. Le lecteur de la page n'est qu'un aperçu. Un avertissement apparaît lorsque la durée mesurée dépasse 15 secondes. Le refus net intervient à 60 secondes ou plus.

3. Choisissez 720 ou 1080, puis confirmez les droits

La sortie par défaut est 1080 à 48 crédits par seconde facturée. 720 coûte 32 crédits par seconde facturée. Confirmez que vous possédez la photo et l'audio, ou que vous avez l'autorisation de les utiliser. Le générateur n'ajoutera pas une seconde voix et ne clonera pas une voix à partir d'un prompt.

4. Générez le MP4 synchronisé

Connectez-vous, dépensez les crédits annoncés et attendez. Les vérifications d'état s'exécutent toutes les quelques secondes et se mettent en pause après quinze minutes. Le même identifiant de requête peut reprendre sans second débit. Si la tâche échoue, les crédits réservés reviennent. Une nouvelle tentative depuis Mes créations ne restaure que l'indice et la résolution. Vous devez réimporter la photo et l'audio.

5. Vérifiez la synchronisation de la bouche, puis téléchargez

Regardez tout le clip. Vérifiez les premiers et derniers phonèmes, les dents et si un second visage a bougé. Téléchargez depuis Mes créations. Traitez le fichier comme un brouillon tant que vous ne l'avez pas vu. Une photo parlante ne remplace pas une interview filmée lorsque l'exactitude juridique ou archivistique compte.

Choisir la bonne voie vidéo

Photo parlante vs avatar parlant vs image-vers-vidéo vs tournage classique

Choisissez la voie qui correspond à vos éléments existants. Une photo parlante a besoin d'une photo et d'une piste importée. Un avatar parlant est un personnage durable. Image-vers-vidéo crée du mouvement à partir d'une photo. Le tournage classique capture une performance réelle sur une timeline.

Photo parlante vs avatar parlant vs image-vers-vidéo vs tournage classique
Photo parlante vs avatar parlant vs image-vers-vidéo vs tournage classiqueIdéal pourContrôleCompromis
Photo parlanteUne vraie photographie d'une personne plus une piste enregistrée que vous pouvez importerVous choisissez la photo, le fichier audio et 720 ou 1080. La durée vient de la pisteLa synchronisation labiale peut dériver. Pas de synthèse vocale, pas de clonage de voix, pas de mouvement de caméra au-delà de ce que le modèle invente autour de la bouche
Avatar parlantUn présentateur numérique réutilisable qui doit apparaître dans de nombreux scriptsLa configuration du personnage et les prises suivantes partagent une identité que vous maintenezVous ne liez pas la sortie à une photographie existante. Les pages d'avatar sont un autre produit
Image-vers-vidéoUne photo qui doit gagner un mouvement de caméra, de la météo ou une lente rotation produit à partir d'un prompt écritImage de départ, image de fin facultative, durée et prompt de mouvementLa bouche n'est pas pilotée par votre audio. Ne l'utilisez pas quand le travail est une photo parlante
Tournage classiqueInterviews, déclarations juridiques et toute prise où la performance réelle doit exister sur une carte mémoireÉclairage, optiques, reprises et un monteur sur une timeline localeLa fidélité la plus élevée et le coût de production le plus élevé. Aucun modèle ne remplace un tournage dont vous avez encore besoin

Ce que cet outil de photo parlante ne promet pas

La sortie est un MP4 synchronisé généré. Ce n'est pas un enregistrement retrouvé du jour de la photo. Ce n'est pas une superposition sans perte de l'audio sur le JPEG. Si le visage est petit, tourné ou couvert, la qualité de synchronisation baisse généralement. Si l'audio est bruité, saturé ou plein de voix qui se chevauchent, le mouvement de la bouche le montrera. Les crédits sont facturés selon les secondes audio mesurées par le serveur. La durée de l'aperçu navigateur n'est pas la facture.

La v1 exige un fichier audio importé par l'utilisateur. Il n'y a pas de champ de synthèse vocale, pas de clonage de voix à partir d'un échantillon et pas de curseur de durée à la génération. Les pistes de 60 secondes ou plus sont refusées. Une durée supérieure à 15 secondes est autorisée sous ce plafond et peut sembler moins stable. Les MP3 à débit variable sans métadonnées de durée lisibles peuvent être refusés même s'ils se lisent dans l'aperçu.

Limites et stockage

Une exécution connectée crée une tâche suivie. Vous pouvez rouvrir le résultat depuis Mes créations après une coupure de connexion sans nouveau débit pour ce même identifiant de requête. Le backend de stockage actuel n'a pas d'expiration automatique pour les objets importés ou générés. La suppression dans Mes créations retire en douceur l'enregistrement de la tâche de l'historique du compte. Elle ne supprime pas l'objet sous-jacent ni une copie du fournisseur. Consultez la politique de confidentialité et les conditions d'utilisation avant d'importer des visages sensibles ou de la parole privée.

Mes créations · Politique de confidentialité · Conditions d'utilisation

Bureau du droit d'auteur des États-Unis, Copyright and Artificial IntelligenceDocuments publics sur les questions de droit d'auteur liées à l'intelligence artificielle. Pas un conseil juridique.

Questions

FAQ photo parlante IA

Des réponses claires sur la synchronisation labiale pilotée par l'audio, les crédits, les limites de durée et ce que cette page ne fait pas.

Que génère une photo parlante IA ?

Un MP4 synchronisé à partir d'une photo fixe et d'une piste audio importée. La bouche est pilotée par cette piste. La photo n'est pas lue comme un diaporama avec le son par-dessus.

Faut-il une photo et un audio ?

Oui en v1. L'atelier exige une photo et un fichier MP3, WAV, AAC, OGG ou M4A importé par l'utilisateur. Il n'y a pas de champ de synthèse vocale et pas de clonage de voix.

Comment les crédits sont-ils facturés ?

Selon les secondes facturées mesurées par le serveur à l'import de l'audio. 32 crédits par seconde en 720. 48 crédits par seconde en 1080. La résolution par défaut est 1080. La durée du lecteur n'est qu'un aperçu.

Quelle longueur peut avoir l'audio ?

Moins de 60 secondes. Un avertissement apparaît au-delà de 15 secondes. 60 secondes ou plus est refusé. Les fichiers de plus de 10 Mo sont refusés. Un MP3 VBR sans métadonnées de durée lisibles peut échouer.

Le visage doit-il être visible ?

Un visage visible est fortement recommandé. Ce n'est pas un verrou logiciel. Les visages occlus ou minuscules produisent généralement une synchronisation labiale plus faible. Inspectez le résultat.

Est-ce la même chose qu'image-vers-vidéo ?

Non. Image-vers-vidéo invente du mouvement à partir d'un prompt. Une photo parlante lie la performance à votre audio importé. Utilisez image-vers-vidéo pour un mouvement de caméra sans piste vocale.

Générez une photo parlante à partir d'une photo et d'une piste

Importez une photo que vous pouvez utiliser, importez l'audio, choisissez 720 ou 1080 et inspectez le MP4 synchronisé avant de le partager.

Ouvrir l'atelier