
創辦人為產品做介紹的入鏡照
一張型錄或到達頁風格的照片:一個人拿著產品,之後錄製一段口播介紹。照片說話適用於照片中既有的臉孔,加上你在安靜房間裡錄製的音訊。讓產品標籤在照片裡保持清晰可讀。不要指望生成器憑空造出第二個機位或另一雙手。
上傳一張臉部可見的照片和一段你錄製或擁有版權的音訊。工具會依這組素材生成唇形同步 MP4。它不是照片加音訊的疊加,也不是通用的圖生影片動作。
音訊 · 必填
照片中臉部清晰可見,唇形同步效果會更好。這是建議,不是硬性限制。 上傳前請先登入。
AI 照片說話是一段短影片 MP4:一張靜態照片看起來在依你既有的聲音說話。你上傳一張照片和一段音訊,生成器會根據這段音軌估算嘴部動作並寫出新的影片畫格。照片不是單純配上音訊播放。通用的圖生影片會依提示詞編造運鏡或天氣,那是另一回事。
理想的輸入是一張臉部清晰、光線良好、嘴部沒有被裁掉的照片。墨鏡、嚴重遮擋、極端側臉,或人群中極小的臉孔都會讓唇形同步更難。這只是品質提示,不是硬性限制。工作台仍會接受符合大小與格式規則的檔案。結果具有機率性:牙齒、舌頭和嘴唇邊緣可能偏移,下顎附近的臉部特徵可能變軟,畫面中出現第二個人時可能帶上多餘動作。發布前請先檢查下載的影片。
Banana Pro AI 依伺服器在上傳時實測的音訊長度計費,而不是瀏覽器播放器顯示的秒數。720 為每秒 32 積分,1080 為每秒 48 積分。計費長度從一秒到 60 秒減一。60 秒以上的音訊會被拒絕。沒有可讀長度中繼資料的可變位元率 MP3 即使預覽正常也可能失敗。選用提示詞最長 300 個字元。v1 不提供文字轉語音、聲音複製、種子或遮罩。
這些畫面是照片說話任務的原始素材和海報,不是生成的唇形同步片段,也不是實拍影片。用它們判斷你自己的照片是否屬於同類輸入。

一張型錄或到達頁風格的照片:一個人拿著產品,之後錄製一段口播介紹。照片說話適用於照片中既有的臉孔,加上你在安靜房間裡錄製的音訊。讓產品標籤在照片裡保持清晰可讀。不要指望生成器憑空造出第二個機位或另一雙手。

一張正式肖像,配上你自己錄製的簡短問候。照片說話可以把記憶中的聲音帶到你有權使用的照片上。它無法還原照片裡沒有的人,也不能保證與每段家庭記憶完全吻合。上傳必須合法,付費前先確認權利。

用於課程、FAQ 或客服影片的主講人照片。生成結果應保留相同的服裝與背景,同時讓嘴部跟隨你上傳的音訊。如果你需要換場景、走動鏡頭或投影片之間的剪接,請改用圖生影片或實拍,而不是這個工作台。
先準備好照片和音軌。只有在伺服器實測音訊後才會報價積分。生成是一個可追蹤任務,可以從「我的作品」重新開啟。
選擇 JPG、PNG 或 WebP,最大 10 MB,每邊至少 256 像素。臉孔在畫面中占合理比例並朝向鏡頭,是照片說話最實在的起點。如果人物太小,先裁剪再上傳。
上傳 MP3、WAV、AAC、OGG 或 M4A,最大 10 MB。最好只有一位說話者且檔案清晰可讀。伺服器會回傳計費秒數。頁面播放器僅供預覽。實測長度超過 15 秒時會提示。60 秒以上會被直接拒絕。
預設輸出 1080,每個計費秒 48 積分。720 每個計費秒 32 積分。請確認你擁有這張照片和這段音訊,或已取得使用許可。生成器不會加入第二個聲音,也不會依提示詞複製聲音。
登入、支付報價積分並等待。狀態檢查每幾秒執行一次,十五分鐘後暫停。同一個請求 id 可以繼續且不會二次扣費。任務失敗時,保留的積分會退回。從「我的作品」重試只會還原提示詞和解析度,照片和音訊需要重新上傳。
完整觀看整段影片。檢查開頭和結尾的音素、牙齒,以及是否有第二張臉在動。從「我的作品」下載。在看完之前把檔案當作草稿。當法律或典藏準確性重要時,照片說話不能取代實拍訪談。
選擇與你既有素材相符的方案。照片說話需要一張照片和一段音訊。數位人播報是一個可長期使用的角色。圖生影片讓照片產生動作。傳統拍攝在時間軸上記錄真實演出。
| 照片說話 vs 數位人播報 vs 圖生影片 vs 傳統拍攝 | 適合 | 可控項目 | 取捨 |
|---|---|---|---|
| 照片說話 | 一張真實的人物照片,加上一段你可以上傳的錄音 | 你選擇照片、音訊檔案和 720 或 1080。長度由音軌決定 | 唇形同步可能偏移。沒有文字轉語音、沒有聲音複製,除模型圍繞嘴部編造的動作外沒有額外運鏡 |
| 數位人播報 | 需要跨多個腳本重複使用的數位主播 | 角色設定和後續每次入鏡共用一個你長期維護的身分 | 輸出不會綁定到某一張既有照片。數位人頁面是另一種產品 |
| 圖生影片 | 希望依文字提示讓照片獲得運鏡、天氣或緩慢產品環繞的動作 | 起始畫格、選用結束畫格、長度和動作提示詞 | 嘴部不由你的音訊驅動。任務本質是照片說話時不要用它 |
| 傳統拍攝 | 訪談、法律聲明,以及任何真實演出必須保存在記憶卡裡的鏡頭 | 佈光、鏡頭、重拍,以及本機時間軸上的剪輯 | 保真度最高,製作成本也最高。沒有模型能取代你仍然需要的實拍 |
輸出是生成的唇形同步 MP4,不是拍攝那張照片當天的錄音還原,也不是把音訊無損疊到 JPEG 上。如果臉孔太小、側向或被遮擋,同步品質通常下降。如果音訊吵雜、削波或多人重疊,嘴部動作會顯露出來。積分依伺服器實測的音訊秒數扣除。瀏覽器預覽長度不等於帳單。
v1 要求使用者上傳音訊檔案。沒有文字轉語音輸入框,不能從樣本複製聲音,生成時也沒有長度滑桿。60 秒以上的音軌會被拒絕。在該上限內,超過 15 秒的長度允許使用,但可能不夠穩定。沒有長度中繼資料的可變位元率 MP3 即使能在預覽中播放也可能被拒絕。
限制與儲存
登入後執行會建立一個可追蹤任務。連線中斷後,你可以從「我的作品」重新開啟結果,同一個請求 id 不會再次扣費。目前儲存後端對上傳或生成的物件沒有自動到期。在「我的作品」中刪除會對帳號歷史裡的工作記錄做軟刪除,但不會刪除底層物件或供應商副本。上傳敏感臉孔或私人語音前,請閱讀隱私權政策和服務條款。
美國著作權局:Copyright and Artificial Intelligence關於人工智慧著作權問題的公開資料,不構成法律建議。當你只有一張照片和一段上傳音訊時,請留在照片說話頁面。當任務是由照片生成動作、更通用的影片生成或數位人身分時,請使用相關工具。
關於音訊驅動的唇形同步、積分、長度限制,以及這個頁面不會做什麼的直接回答。
用一張照片和一段上傳音訊生成的唇形同步 MP4。嘴部由這段音軌驅動,不是把照片當作投影片配上聲音。
v1 中是。工作台需要一張照片和一個使用者上傳的 MP3、WAV、AAC、OGG 或 M4A 檔案。沒有文字轉語音輸入框,也沒有聲音複製。
依伺服器在上傳音訊時實測的計費秒數。720 每秒 32 積分,1080 每秒 48 積分,預設解析度是 1080。播放器長度僅供預覽。
短於 60 秒。超過 15 秒會提示。60 秒以上會被拒絕。超過 10 MB 的檔案會被拒絕。沒有可讀長度中繼資料的 VBR MP3 可能失敗。
強烈建議使用臉部清晰可見的照片。這不是硬性限制。被遮擋或過小的臉孔通常唇形同步較弱,請檢查結果。
不一樣。圖生影片依提示詞編造動作,照片說話把演出鎖定到你上傳的音訊。想要沒有聲音的運鏡時,請用圖生影片。