音频驱动唇形同步

AI 照片说话

上传一张人脸可见的照片和一段你录制或拥有版权的音频。工具会根据这组素材生成唇形同步 MP4。它不是照片加音频的叠加,也不是通用的图生视频运动。

照片 · 必填(0/1)

音频 · 必填

照片中人脸清晰可见,唇形同步效果会更好。这是建议,不是硬性限制。 上传前请先登录。

0 / 300
分辨率
需要账号32 积分/秒(720)· 48 积分/秒(1080)
预览就绪

添加一张照片和一段音频

使用人脸可见的照片和清晰的上传音轨。生成完成后,MP4 会替换此预览。

32 积分/秒(720)· 48 积分/秒(1080)· 按实测音频秒数计费
打开我的作品
直接回答

什么是 AI 照片说话?

AI 照片说话是一段短视频 MP4:一张静态照片看起来在按你已有的声音说话。你上传一张照片和一段音频,生成器根据这段音轨估算嘴部动作并写出新的视频帧。照片不是简单地配上音频播放。通用的图生视频会根据提示词编造运镜或天气,那是另一回事。

理想的输入是一张人脸清晰、光线良好、嘴部没有被裁掉的照片。墨镜、严重遮挡、极端侧脸,或人群中极小的人脸都会让唇形同步更难。这只是质量提示,不是硬性限制。工作台仍会接受符合大小和格式规则的文件。结果具有概率性:牙齿、舌头和嘴唇边缘可能偏移,下颌附近的面部特征可能变软,画面中出现第二个人时可能带上多余动作。发布前请先检查下载的视频。

Banana Pro AI 按服务器在上传时实测的音频时长计费,而不是浏览器播放器显示的秒数。720 为每秒 32 积分,1080 为每秒 48 积分。计费时长从一秒到 60 秒减一。60 秒及以上的音频会被拒绝。没有可读时长元数据的可变码率 MP3 即使预览正常也可能失败。可选提示词最长 300 个字符。v1 不提供文字转语音、声音克隆、种子或蒙版。

商业照片说话任务的原始素材

三张原始素材海报,不是生成结果

这些画面是照片说话任务的原始素材和海报,不是生成的唇形同步片段,也不是实拍视频。用它们判断你自己的照片是否属于同类输入。

创始人拿着产品的原始素材海报,用作照片说话的输入,而非生成的视频片段
原始素材
静态海报

创始人为产品做介绍的出镜照

一张目录或落地页风格的照片:一个人拿着产品,之后录制一段口播介绍。照片说话适用于照片中已有的人脸,加上你在安静房间里录制的音频。让产品标签在照片里保持清晰可读。不要指望生成器凭空造出第二个机位或另一双手。

用作照片说话输入的正式肖像原始素材海报,而非现场纪念视频
原始素材
静态海报

用家庭照片表达的纪念问候

一张正式肖像,配上你自己录制的简短问候。照片说话可以把记忆中的声音带到你有权使用的照片上。它无法还原照片里没有的人,也不能保证与每段家庭记忆完全吻合。上传必须合法,付费前先确认权利。

正面面对镜头的主讲人原始素材海报,用作照片说话输入,而非成片讲解视频
原始素材
静态海报

用主讲人照片做讲解

用于课程、FAQ 或客服视频的主讲人照片。生成结果应保留相同的服装和背景,同时让嘴部跟随你上传的音频。如果你需要换场景、走动镜头或幻灯片之间的剪切,请改用图生视频或实拍,而不是这个工作台。

实用流程

如何用照片和音频制作照片说话视频

先准备好照片和音轨。只有在服务器实测音频后才会报价积分。生成是一个可追踪任务,可以从「我的作品」重新打开。

1. 上传一张人脸可见的照片

选择 JPG、PNG 或 WebP,最大 10 MB,每条边至少 256 像素。人脸在画面中占合理比例并朝向镜头,是照片说话最实在的起点。如果人物太小,先裁剪再上传。

2. 上传驱动嘴部的音轨

上传 MP3、WAV、AAC、OGG 或 M4A,最大 10 MB。最好只有一位说话人且文件清晰可读。服务器会返回计费秒数。页面播放器仅供预览。实测时长超过 15 秒时会提示。60 秒及以上会被直接拒绝。

3. 选择 720 或 1080,并确认权利

默认输出 1080,每个计费秒 48 积分。720 每个计费秒 32 积分。请确认你拥有这张照片和这段音频,或已获得使用许可。生成器不会添加第二个声音,也不会根据提示词克隆声音。

4. 生成唇形同步 MP4

登录、支付报价积分并等待。状态检查每几秒运行一次,十五分钟后暂停。同一个请求 id 可以继续且不会二次扣费。任务失败时,预留积分会退回。从「我的作品」重试只会恢复提示词和分辨率,照片和音频需要重新上传。

5. 检查口型同步,然后下载

完整观看整段视频。检查开头和结尾的音素、牙齿,以及是否有第二张脸在动。从「我的作品」下载。在看完之前把文件当作草稿。当法律或存档准确性重要时,照片说话不能替代实拍采访。

选择合适的视频方案

照片说话 vs 数字人播报 vs 图生视频 vs 传统拍摄

选择与你已有素材匹配的方案。照片说话需要一张照片和一段音频。数字人播报是一个可长期使用的角色。图生视频让照片产生运动。传统拍摄在时间线上记录真实表演。

照片说话 vs 数字人播报 vs 图生视频 vs 传统拍摄
照片说话 vs 数字人播报 vs 图生视频 vs 传统拍摄适合可控项代价
照片说话一张真实的人物照片,加上一段你可以上传的录音你选择照片、音频文件和 720 或 1080。时长由音轨决定唇形同步可能偏移。没有文字转语音、没有声音克隆,除模型围绕嘴部编造的动作外没有额外运镜
数字人播报需要跨多个脚本复用的数字主播角色设置和后续每次出镜共享一个你长期维护的身份输出不会绑定到某一张已有照片。数字人页面是另一种产品
图生视频希望根据文字提示让照片获得运镜、天气或缓慢产品环绕的运动起始帧、可选结束帧、时长和运动提示词嘴部不由你的音频驱动。任务本质是照片说话时不要用它
传统拍摄采访、法律声明,以及任何真实表演必须保存在存储卡里的镜头布光、镜头、重拍,以及本地时间线上的剪辑保真度最高,制作成本也最高。没有模型能替代你仍然需要的实拍

这个照片说话工具不会承诺的事

输出是生成的唇形同步 MP4,不是拍摄那张照片当天的录音复原,也不是把音频无损叠到 JPEG 上。如果人脸太小、侧向或被遮挡,同步质量通常下降。如果音频嘈杂、削波或多人重叠,嘴部动作会暴露出来。积分按服务器实测的音频秒数扣除。浏览器预览时长不等于账单。

v1 要求用户上传音频文件。没有文字转语音输入框,不能从样本克隆声音,生成时也没有时长滑块。60 秒及以上的音轨会被拒绝。在该上限内,超过 15 秒的时长允许使用,但可能不够稳定。没有时长元数据的可变码率 MP3 即使能在预览中播放也可能被拒绝。

限制与存储

登录后运行会创建一个可追踪任务。连接中断后,你可以从「我的作品」重新打开结果,同一个请求 id 不会再次扣费。当前存储后端对上传或生成的对象没有自动过期。在「我的作品」中删除会对账号历史里的任务记录做软删除,但不会删除底层对象或供应商副本。上传敏感人脸或私人语音前,请阅读隐私政策和服务条款。

我的作品 · 隐私政策 · 服务条款

美国版权局:Copyright and Artificial Intelligence关于人工智能版权问题的公开资料,不构成法律建议。

相关视频工具

Banana Pro AI 的其他视频方案

当你只有一张照片和一段上传音频时,请留在照片说话页面。当任务是由照片生成运动、更通用的视频生成或数字人身份时,请使用相关工具。

常见问题

AI 照片说话常见问题

关于音频驱动的唇形同步、积分、时长限制,以及这个页面不会做什么的直接回答。

AI 照片说话会生成什么?

用一张照片和一段上传音频生成的唇形同步 MP4。嘴部由这段音轨驱动,不是把照片当作幻灯片配上声音。

照片和音频都需要吗?

v1 中是的。工作台需要一张照片和一个用户上传的 MP3、WAV、AAC、OGG 或 M4A 文件。没有文字转语音输入框,也没有声音克隆。

照片说话的积分如何计费?

按服务器在上传音频时实测的计费秒数。720 每秒 32 积分,1080 每秒 48 积分,默认分辨率是 1080。播放器时长仅供预览。

音频可以多长?

短于 60 秒。超过 15 秒会提示。60 秒及以上会被拒绝。超过 10 MB 的文件会被拒绝。没有可读时长元数据的 VBR MP3 可能失败。

人脸必须可见吗?

强烈建议使用人脸清晰可见的照片。这不是硬性限制。被遮挡或过小的人脸通常唇形同步更弱,请检查结果。

这和图生视频一样吗?

不一样。图生视频根据提示词编造运动,照片说话把表演锁定到你上传的音频。想要没有声音的运镜时,请用图生视频。

用一张照片和一段音轨生成 AI 照片说话视频

上传你有权使用的照片和音频,选择 720 或 1080,在分享前检查唇形同步 MP4。

打开工作台