多模態影片生成 · 4~15 秒 · 768P 或 2K
從文字、首張或末張影格,以及圖片、影片、音訊參考開始。在一個獨立的網頁工作區裡,導出 24 FPS、內含 32 kHz 立體聲原生音訊的影片。
獨立服務。與 MiniMax 或任何模型擁有者皆無隸屬、背書或贊助關係。
MiniMax H3 指南 / 2026 年 8 月 5 日校對
MiniMax H3 AI 是一套能同時理解文字、圖片、影片與音訊脈絡的多模態影片生成流程。 你可以用開放式提示詞、首張或末張影格,或是一組結構化的視覺與聲音參考,產生 4~15 秒、768P 或 2K、24 FPS,並內含 32 kHz 立體聲原生音訊的片段。
當構圖可以自己發明時就用文字。好的提示詞讀起來像分鏡指示:主體、動作、環境、鏡位與運鏡、光線、節奏,以及最重要的那個聲音。必須守住的連續性條件要寫在裝飾性風格之前。六種固定畫面比例涵蓋寬螢幕、橫式、方形與直式,片長則是 4 到 15 秒之間的任一整數秒。
這條路徑適合概念探索、社群開頭鉤子、氣氛插入鏡頭、商品鏡頭與電影感 B-roll。因為沒有上傳素材可以掩護,它同時也是最乾淨的測試方式:你能直接看出模型有沒有讀懂那段文字。多產幾個版本、把設定記下來,然後用「實際可用的秒數」來挑,而不是挑縮圖最好看的那個。
照片動態化至少需要一張首影格或末影格;當一段轉場需要兩個定位點時,兩張都給也可以。影格決定構圖,所以這個模式不會另外送出畫面比例參數。你要描述的是時間軸上的變化:運鏡移動、身體動作、環境反應、時間點,以及哪些東西必須保持不動。把畫面上看得到的細節再寫一遍,只會浪費提示詞空間並製造衝突。
首影格適合讓主視覺、商品照、插畫或一格分鏡動起來;末影格則多用在揭露與變形這種需要控制「終點」的鏡頭。由於影格模式與參考模式互斥,上傳檔案之前先決定:這顆鏡頭要的是終點構圖,還是更廣的人物一致性與動態脈絡。
參考模式最多接受 9 張圖片、3 支影片與 3 段音訊,合計 12 個檔案。影片與音訊各自需在 2 到 15 秒之間,同一類媒體的總長度也不得超過 15 秒。音訊不能單獨作為唯一參考,請至少搭配一張圖片或一支影片。每個檔案只負責一件事:一張定人物、一張定服裝、一張定場景;短影片示範運鏡律動或表演節拍,音訊則交代時間點、空間感與音色。檔案不是越多越好,重複或互相矛盾的參考要拿掉,並在提示詞裡講明哪個屬性取自哪個來源。
快速探索用 768P,需要檢視材質、髮絲、環境細節或交付尺寸較大時再用 2K。解析度救不了鬆散的構圖或不穩的動作,先用便宜的設定把方向確定下來比較划算。費用會依輸出片長、參考影片長度,以及第六張起的圖片計算,畫面上的估算只是參考,伺服器會依上傳檔案的中繼資料重新計價。原生音訊是與畫面一起產生的,寫聲音時請寫成物理指示:距離、質地、時間點、空間殘響、一次同步的撞擊,或一句短台詞。發布前務必確認發音、對嘴、破音、非預期的配樂、左右聲道平衡與授權狀態。
電商短影音。 在正式開拍之前先試商品揭露、材質特寫與直式開頭鉤子。商標、包裝文字、售價與法規標示請在剪輯階段確定加上。
社群素材與廣告初稿。 短時間內把幾個方向並排比較,用參考素材統一調性,讓內部討論不必只憑感覺。
角色與品牌識別鏡頭。 用正面與側面參考圖維持同一個人物,再產生轉身、走位等鏡頭。參考素材請只使用已取得授權的自有檔案。
光看模型名稱回答不了製作需求。我們以英文撰寫的實測比較 MiniMax H3 vs Seedance 2 與 MiniMax H3 vs Flux 3 Video區分了已公開的能力與未知數,並附上動態、參考、音訊、片長與「每顆可用鏡頭成本」的可重複測試方法。
構圖可以自由發揮就用文字,起點或終點已經確定就用影格,人物、動作或聲音需要具體依據時再用多模態參考。
先寫主體與動作,再補環境、運鏡路徑、光線、節奏、必須維持的連續性條件,以及一兩個關鍵聲音。有優先順序的提示詞,效果遠勝一長串形容詞。不想出現的元素請寫成否定句。
一次只選一種輸入方式。起點或終點構圖已經確定就用影格;人物一致性、動作、節奏或氛圍用檔案比用文字更準時,就改用參考模式。兩者在同一次請求中不能並用。
檢查提示詞是否被吃進去、肢體與物件有無崩壞、運鏡是否連續、實際可用的秒數,以及聲音是否對得上。留下有效的設定,下一次只改一個變數,讓每次產生都在回答一個具體問題。
選一種輸入方式,設定 4~15 秒與 768P 或 2K,產生後到「我的作品」檢視結果。
依照輸出解析度、片長、參考影片秒數與製作量挑選方案。
Billed $238.80 yearly
Billed $418.80 yearly
Billed $898.80 yearly
Included models
Credits activate instantly for MiniMax H3 generation workflows.

商用權利依你選擇的付費方案、本站服務條款,以及上游模型供應商的規範而定。用體驗額度做出來的成品,建議先確認付費方案條件再放到廣告或銷售頁。商標、售價、成分與法規標示這類不能出錯的資訊,請在後製階段用剪輯軟體確定加上,不要交給模型生成。
以本站付費方案產出的影片不會加上平台浮水印。若你在提示詞或參考檔案中帶入了含浮水印的素材,模型可能會把那個視覺特徵一起學進畫面,這種情況要換掉參考素材,而不是靠後製塗掉。
可以。重點不在語言,而在拆解的細緻度:先寫主體與動作,再補環境、鏡位與運鏡、光線、節奏、必須維持不變的條件,最後只挑一兩個關鍵聲音。整段堆形容詞的效果,遠不如把優先順序寫清楚。不想出現的元素請直接寫成否定句。
文字生成影片適合構圖可以從零開始的情況,六種固定畫面比例涵蓋橫式、方形與直式。照片動態化(首尾影格)則是先給定起點或終點畫面,讓模型只負責時間軸上的變化,構圖由你那張圖決定,所以這個模式不會另外送出畫面比例參數。兩者在同一次請求中不能與多模態參考同時使用。
2K 指的是輸出解析度,適合要檢視布料、髮絲、材質與環境細節的鏡頭。原生音訊指的是畫面與聲音一起產生,而不是事後貼上音軌。要注意「原生」講的是產生方式,不保證發音、對嘴、音量平衡達到成品水準,發布前一定要整段看完聽完。
不是。本站是獨立的 AI 生成服務,與 MiniMax、ByteDance、Black Forest Labs、Flux 或任何模型擁有者皆無隸屬、背書或贊助關係。你的帳號、點數、帳務、檔案與客服都由本站提供。