一次生成畫面、音效和人聲?MiniMax H3 想解決 AI 影片最麻煩的問題
不只輸入文字,還能參考圖片與既有影片;真正值得注意的,是它開始把原本分散的製作流程合在一起
以前使用 AI 製作影片,通常不是按下一個按鈕就能完成。
你可能先用圖片模型產生角色,再把圖片送進影片模型,接著另外尋找背景音效、生成配音,最後還要處理嘴型同步。
畫面、聲音與角色表演,分散在不同工具裡。
只要其中一個環節出錯,就要重新產生、重新下載,再回到剪輯軟體裡調整。
最近我看到一款 MiniMax 的多模態影片生成模型 H3。
它最吸引人的地方,不只是能把文字變成影片,而是嘗試把圖片參考、影片參考、背景聲音與角色人聲,放進同一次生成流程裡。
換句話說,我們正在從:
先生成畫面,再替畫面補聲音
逐漸走向:
讓模型同時理解畫面、動作、環境與聲音
如果實際效果與穩定性足夠,這可能會明顯改變 AI 影片的製作方式。
它不只支援文字生成影片
傳統的文字生成影片,是先輸入一段描述:
一名女子走在下雨的夜市,鏡頭從遠處慢慢靠近,周圍充滿霓虹燈與行人。
接著讓模型自行決定人物外觀、場景構圖與動作。
這種方式速度很快,但不容易維持固定角色。
即使使用完全相同的描述,每次生成的人物五官、衣服與環境細節,仍可能出現差異。
H3 類型的多模態工作流,除了文字提示之外,還能進一步加入其他參考素材。
圖片參考
提供角色、產品或場景圖片,讓模型根據指定視覺延伸動作。
適合用來製作:
- 商品展示
- 固定角色短片
- 插畫動態化
- 漫畫人物動畫
- 社群廣告
- 影片轉場素材
圖片參考的重點,不只是讓圖片「動起來」。
真正有價值的是,能否在不同鏡頭裡維持角色、服裝、產品及整體風格的一致性。
影片參考
除了圖片,還可以使用既有影片作為動作或視覺參考。
例如提供一段人物運鏡、肢體動作或鏡頭節奏,再要求模型以另一個角色或場景重新呈現。
這類功能可能適合:
- 模仿攝影機運動
- 參考人物動作
- 延伸既有片段
- 改變影片視覺風格
- 製作相似節奏的廣告素材
但這裡也要特別注意素材授權。
能夠參考一段影片,不代表可以直接複製他人的角色、作品或商業廣告。公開發布前,仍要確認來源與使用權。
真正值得注意的,是聲音開始進入生成流程
過去許多 AI 影片模型只負責畫面。
如果想讓成品有聲音,通常還要自己完成:
- 生成或尋找背景音效
- 另外產生配音
- 對齊人物嘴型
- 調整聲音時間
- 最後重新混音
這些工作單獨看都不困難,但加在一起非常耗時。
尤其短影片只有十幾秒,製作聲音花費的時間,可能比生成畫面本身還久。
H3 這類模型的方向,是讓一次生成同時包含:
- 場景環境音
- 物件聲音
- 背景音效
- 角色人聲
- 口型同步
- 畫面與聲音的時間關係
例如畫面裡有人在街道奔跑,系統不只需要產生跑步動作,還要理解腳步、交通、風聲與空間感。
如果角色同時說話,嘴型、表情及聲音時間也必須一致。
這代表模型處理的已經不是單一視覺畫面,而是一整段視聽事件。
有音效,不代表可以直接發布
一次生成聲音確實方便,但它也帶來新的檢查工作。
人聲是否符合角色?
聲線的年齡、情緒與語速,可能與畫面人物不一致。
嘴型是否真的同步?
某些短句看起來自然,句子一長、轉頭或遮住嘴巴後,就可能開始失準。
環境音是否合理?
室內外空間、距離與材質不同,聲音反射也會不同。生成結果可能有聲音,卻沒有合理的空間感。
聲音是否突然消失?
AI 影片常在鏡頭切換、人物轉身或畫面變化時,產生不連續的聲音。
是否出現不需要的人聲?
模型可能錯誤解讀畫面,替背景人物加入含糊說話聲,或生成聽似語言、實際沒有意義的內容。
因此,一次生成「畫面+聲音」比較像是縮短第一版製作時間,不代表省略後製。
真正要公開的影片,仍然需要人工檢查字幕、發音、音量、噪音與口型。
榜單第一,不等於適合所有人
影片中提到 H3 在榜單上超越 Google 的 Omni。
這類排名可以作為參考,但不能只看一個總分就決定使用哪款工具。
AI 影片模型的榜單,通常受到多項條件影響:
- 使用哪個版本
- 文字生成還是圖片生成
- 是否包含聲音
- 影片長度
- 參與評分的人數
- 偏好寫實還是風格化畫面
- 比較日期
- 是否使用相同提示詞及設定
而且榜單會隨模型更新持續變動。
對創作者來說,更實際的判斷方式是:
- 中文提示詞理解是否準確
- 人物一致性是否穩定
- 動作會不會變形
- 產生速度能不能接受
- 每次生成需要多少成本
- 失敗後能否快速修改
- 影片能否商業使用
- 聲音與口型是否真的省下後製時間
第一名模型不一定最適合你的工作。
真正重要的是,它在你的題材與流程裡,能不能穩定產生可以使用的結果。
「免費」和「開源」是兩件不同的事
影片中也提到 H3 支援開源並且免費。
這裡必須把幾個概念分開。
免費試用
平台提供新帳號額度、每日點數或限時免費活動。
額度使用完後,可能需要付費。
免費使用
在特定條件內可以不付費,但可能限制解析度、影片長度、生成速度或商業用途。
開放存取
使用者可以透過網站或 API 操作模型,但不一定能取得模型權重。
開放原始碼或開放權重
代表程式碼或模型權重以特定授權方式公開,可否商用、修改或重新散布,仍取決於授權內容。
所以,「網站能免費生成」不等於「模型是開源的」。
文章發布時,建議不要直接承諾讀者它永久免費,也不要只看到社群貼文,就判定模型可以任意商用。
最安全的方式,是在使用前查看官方當下的:
- 方案與點數
- 模型授權
- 商業使用條款
- 隱私政策
- 上傳素材的資料處理方式
最適合拿它做哪些內容?
這類多模態影片模型,我認為現階段最適合用來加速以下工作。
1. 社群短片素材
生成數秒鐘的開場、示意畫面或視覺轉場,再放進原本的剪輯流程。
2. 產品概念展示
透過產品圖片,快速測試不同場景、運鏡與廣告方向。
3. 無臉內容
不需要真人出鏡,也能使用插畫角色、抽象視覺或情境畫面搭配口播。
4. 分鏡預覽
正式拍攝前,先把腳本製作成概念片,檢查鏡頭與節奏是否成立。
5. 故事型短片
利用角色圖片與情境提示,產生多段畫面,再透過剪輯組成完整故事。
但我不建議一開始就要求它生成一支完整的一分鐘影片。
時間越長,角色與場景越容易漂移,修改成本也會快速增加。
更穩定的方法,是先拆成數個短鏡頭,再逐段生成與剪輯。
一次生成,不代表一次成功
AI 影片最容易製造的錯覺,就是看起來什麼都能做。
輸入一句提示詞,幾分鐘後就出現一段有畫面、有聲音的影片。
但真正進入內容製作後,你會發現困難沒有消失,只是換了位置。
以前的問題是:
我該怎麼製作這個畫面?
現在的問題變成:
我該怎麼描述,才能讓模型理解我真正想要的畫面?
你仍然需要決定:
- 角色是誰
- 場景在哪裡
- 正在發生什麼
- 鏡頭如何移動
- 影片維持多久
- 希望觀眾感受到什麼
- 需要哪些聲音
- 哪些元素不能出現
生成工具越強,提示詞裡的導演思維就越重要。