
创始人为产品做介绍的出镜照
一张目录或落地页风格的照片:一个人拿着产品,之后录制一段口播介绍。照片说话适用于照片中已有的人脸,加上你在安静房间里录制的音频。让产品标签在照片里保持清晰可读。不要指望生成器凭空造出第二个机位或另一双手。
上传一张人脸可见的照片和一段你录制或拥有版权的音频。工具会根据这组素材生成唇形同步 MP4。它不是照片加音频的叠加,也不是通用的图生视频运动。
音频 · 必填
照片中人脸清晰可见,唇形同步效果会更好。这是建议,不是硬性限制。 上传前请先登录。
AI 照片说话是一段短视频 MP4:一张静态照片看起来在按你已有的声音说话。你上传一张照片和一段音频,生成器根据这段音轨估算嘴部动作并写出新的视频帧。照片不是简单地配上音频播放。通用的图生视频会根据提示词编造运镜或天气,那是另一回事。
理想的输入是一张人脸清晰、光线良好、嘴部没有被裁掉的照片。墨镜、严重遮挡、极端侧脸,或人群中极小的人脸都会让唇形同步更难。这只是质量提示,不是硬性限制。工作台仍会接受符合大小和格式规则的文件。结果具有概率性:牙齿、舌头和嘴唇边缘可能偏移,下颌附近的面部特征可能变软,画面中出现第二个人时可能带上多余动作。发布前请先检查下载的视频。
Banana Pro AI 按服务器在上传时实测的音频时长计费,而不是浏览器播放器显示的秒数。720 为每秒 32 积分,1080 为每秒 48 积分。计费时长从一秒到 60 秒减一。60 秒及以上的音频会被拒绝。没有可读时长元数据的可变码率 MP3 即使预览正常也可能失败。可选提示词最长 300 个字符。v1 不提供文字转语音、声音克隆、种子或蒙版。
这些画面是照片说话任务的原始素材和海报,不是生成的唇形同步片段,也不是实拍视频。用它们判断你自己的照片是否属于同类输入。

一张目录或落地页风格的照片:一个人拿着产品,之后录制一段口播介绍。照片说话适用于照片中已有的人脸,加上你在安静房间里录制的音频。让产品标签在照片里保持清晰可读。不要指望生成器凭空造出第二个机位或另一双手。

一张正式肖像,配上你自己录制的简短问候。照片说话可以把记忆中的声音带到你有权使用的照片上。它无法还原照片里没有的人,也不能保证与每段家庭记忆完全吻合。上传必须合法,付费前先确认权利。

用于课程、FAQ 或客服视频的主讲人照片。生成结果应保留相同的服装和背景,同时让嘴部跟随你上传的音频。如果你需要换场景、走动镜头或幻灯片之间的剪切,请改用图生视频或实拍,而不是这个工作台。
先准备好照片和音轨。只有在服务器实测音频后才会报价积分。生成是一个可追踪任务,可以从「我的作品」重新打开。
选择 JPG、PNG 或 WebP,最大 10 MB,每条边至少 256 像素。人脸在画面中占合理比例并朝向镜头,是照片说话最实在的起点。如果人物太小,先裁剪再上传。
上传 MP3、WAV、AAC、OGG 或 M4A,最大 10 MB。最好只有一位说话人且文件清晰可读。服务器会返回计费秒数。页面播放器仅供预览。实测时长超过 15 秒时会提示。60 秒及以上会被直接拒绝。
默认输出 1080,每个计费秒 48 积分。720 每个计费秒 32 积分。请确认你拥有这张照片和这段音频,或已获得使用许可。生成器不会添加第二个声音,也不会根据提示词克隆声音。
登录、支付报价积分并等待。状态检查每几秒运行一次,十五分钟后暂停。同一个请求 id 可以继续且不会二次扣费。任务失败时,预留积分会退回。从「我的作品」重试只会恢复提示词和分辨率,照片和音频需要重新上传。
完整观看整段视频。检查开头和结尾的音素、牙齿,以及是否有第二张脸在动。从「我的作品」下载。在看完之前把文件当作草稿。当法律或存档准确性重要时,照片说话不能替代实拍采访。
选择与你已有素材匹配的方案。照片说话需要一张照片和一段音频。数字人播报是一个可长期使用的角色。图生视频让照片产生运动。传统拍摄在时间线上记录真实表演。
| 照片说话 vs 数字人播报 vs 图生视频 vs 传统拍摄 | 适合 | 可控项 | 代价 |
|---|---|---|---|
| 照片说话 | 一张真实的人物照片,加上一段你可以上传的录音 | 你选择照片、音频文件和 720 或 1080。时长由音轨决定 | 唇形同步可能偏移。没有文字转语音、没有声音克隆,除模型围绕嘴部编造的动作外没有额外运镜 |
| 数字人播报 | 需要跨多个脚本复用的数字主播 | 角色设置和后续每次出镜共享一个你长期维护的身份 | 输出不会绑定到某一张已有照片。数字人页面是另一种产品 |
| 图生视频 | 希望根据文字提示让照片获得运镜、天气或缓慢产品环绕的运动 | 起始帧、可选结束帧、时长和运动提示词 | 嘴部不由你的音频驱动。任务本质是照片说话时不要用它 |
| 传统拍摄 | 采访、法律声明,以及任何真实表演必须保存在存储卡里的镜头 | 布光、镜头、重拍,以及本地时间线上的剪辑 | 保真度最高,制作成本也最高。没有模型能替代你仍然需要的实拍 |
输出是生成的唇形同步 MP4,不是拍摄那张照片当天的录音复原,也不是把音频无损叠到 JPEG 上。如果人脸太小、侧向或被遮挡,同步质量通常下降。如果音频嘈杂、削波或多人重叠,嘴部动作会暴露出来。积分按服务器实测的音频秒数扣除。浏览器预览时长不等于账单。
v1 要求用户上传音频文件。没有文字转语音输入框,不能从样本克隆声音,生成时也没有时长滑块。60 秒及以上的音轨会被拒绝。在该上限内,超过 15 秒的时长允许使用,但可能不够稳定。没有时长元数据的可变码率 MP3 即使能在预览中播放也可能被拒绝。
限制与存储
登录后运行会创建一个可追踪任务。连接中断后,你可以从「我的作品」重新打开结果,同一个请求 id 不会再次扣费。当前存储后端对上传或生成的对象没有自动过期。在「我的作品」中删除会对账号历史里的任务记录做软删除,但不会删除底层对象或供应商副本。上传敏感人脸或私人语音前,请阅读隐私政策和服务条款。
美国版权局:Copyright and Artificial Intelligence关于人工智能版权问题的公开资料,不构成法律建议。当你只有一张照片和一段上传音频时,请留在照片说话页面。当任务是由照片生成运动、更通用的视频生成或数字人身份时,请使用相关工具。
关于音频驱动的唇形同步、积分、时长限制,以及这个页面不会做什么的直接回答。
用一张照片和一段上传音频生成的唇形同步 MP4。嘴部由这段音轨驱动,不是把照片当作幻灯片配上声音。
v1 中是的。工作台需要一张照片和一个用户上传的 MP3、WAV、AAC、OGG 或 M4A 文件。没有文字转语音输入框,也没有声音克隆。
按服务器在上传音频时实测的计费秒数。720 每秒 32 积分,1080 每秒 48 积分,默认分辨率是 1080。播放器时长仅供预览。
短于 60 秒。超过 15 秒会提示。60 秒及以上会被拒绝。超过 10 MB 的文件会被拒绝。没有可读时长元数据的 VBR MP3 可能失败。
强烈建议使用人脸清晰可见的照片。这不是硬性限制。被遮挡或过小的人脸通常唇形同步更弱,请检查结果。
不一样。图生视频根据提示词编造运动,照片说话把表演锁定到你上传的音频。想要没有声音的运镜时,请用图生视频。