マルチモーダル動画生成 ・ 4〜15 秒 ・ 768P / 2K
MiniMax H3 動画生成AI映像と音を同時に作る、参照ベースの制作
テキスト、最初または最後のフレーム、画像・動画・音声の参照から作れます。24 FPS・32 kHz ステレオのネイティブ音声つき映像を、ブラウザだけの独立ワークスペースで演出できます。
独立したサービスです。MiniMax およびいかなるモデル所有者とも、提携・承認・後援の関係はありません。
MiniMax H3 ガイド / 2026年8月5日 確認
プロンプトから検証まで、実務で使う H3 の進め方
MiniMax H3 AI は、テキスト・画像・動画・音声の文脈を扱えるマルチモーダルな動画生成AI のワークフローです。 自由記述のプロンプト、最初または最後のフレーム、構造化した視覚・音の参照のいずれかを使って、768P または 2K・24 FPS・32 kHz ステレオのネイティブ音声つきで 4〜15 秒のクリップを作れます。
構図を自由に決めるテキスト生成
ゼロから構図を作れる場合はテキストから始めます。使えるプロンプトは撮影指示に近く、被写体、動作、環境、カメラの位置と動き、照明、テンポ、そして最も重要な音を順に指定します。装飾的なスタイル語よりも、崩してはいけない条件を先に書いてください。画面比は 6 種類の固定値から選び、尺は 4 秒から 15 秒まで 1 秒単位で指定できます。

この方式はコンセプト検討、SNS の冒頭カット、雰囲気づくりのインサート、商品の見せ場、シネマティックな B ロールに向いています。アップロード素材が結果を補わないため、モデルが文章を理解したかどうかを素直に確認できる比較テストにもなります。候補を複数作り、設定を記録し、サムネイルの見栄えではなく「実際に使える秒数」で選んでください。
始点・終点を決めるフレーム指定
Image-to-video では最初のフレームか最後のフレームが最低 1 枚必要で、2 つの基準点をつなぐ遷移が要る場合は両方を指定できます。フレームが構図を決めるため、このモードでは画面比のパラメータを別送しません。時間とともに変化するもの(カメラの移動、体の動き、環境の反応、タイミング)と、変えてはいけないものを書き分けてください。画面に写っている細部をすべて書き直すのは、指示の枠を無駄に使ううえ矛盾のもとになります。

最初のフレーム指定は、キービジュアル、商品写真、イラスト、絵コンテの 1 コマを動かす用途に向きます。最後のフレームは、変身や商品の公開といった「到達点」を制御したいときに効きます。フレーム指定と参照モードは併用できないので、必要なのが終点の構図なのか、それとも人物の同一性と動きの文脈なのかを、ファイルを上げる前に決めてください。
参照ファイルでキャラクターの一貫性を保つ
参照モードは画像 9 点、動画 3 点、音声 3 点まで、合計 12 ファイルを受け取ります。動画と音声はそれぞれ 2〜15 秒で、同じ種類の合計も 15 秒以内です。音声だけを参照にはできないため、視覚的な文脈として画像か動画を必ず添えてください。

ファイル 1 点につき役割を 1 つに絞るのが要点です。ある画像は人物の同一性、別の画像は衣装、さらに別の画像は場所を定義する、という分け方です。短い動画はカメラのリズムや演技の間を示し、音声はタイミング・空間の響き・音色を伝えます。正面と側面の人物画像を入れると、髪色や服装、顔の特徴を保ちやすくなります。ただし枚数は多いほど良いわけではありません。重複や矛盾のある参照は外し、どの属性をどのファイルから取るのかをプロンプトで明言してください。
2K の細部とネイティブ音声の扱い
素早い検証には 768P、質感・髪・素材・環境の細部や大きな納品フレームが追加クレジットに見合う場合は 2K を選びます。解像度は弱い構図や不安定な動きを救いません。まず安い設定で方向性を確定させてから、最終形に費用をかけてください。費用は出力の尺、参照動画の尺、6 枚目以降の画像で変わります。画面上の見積もりは目安で、サーバー側がアップロードのメタデータから再計算します。

ネイティブ音声は、別録りの音源を後付けするのではなく映像と同時に生成されます。音は物理的な指示として書いてください。距離、質感、タイミング、部屋の響き、同期した打撃音、短い一言のセリフ、といった具合です。公開前には発音、口の動き、音割れ、意図しない音楽、左右のバランス、権利関係を必ず確認します。「ネイティブ」は生成方法を指す言葉で、仕上がったミックスを保証するものではありません。
商用利用と権利まわりで先に決めておくこと
法人利用では、生成の前に確認すべきことが 2 つあります。1 つはプランです。商用利用の権利は選択した有料プラン、利用規約、上流モデル提供元のルールに従うため、体験クレジットで作った素材をそのまま広告に回さないでください。もう 1 つは入力です。特定の作品名、芸能人名、他社ロゴをプロンプトや参照ファイルに入れると、出力が既存の著作物や実在の人物に酷似したときに依拠性を問われる余地が生まれます。

運用としては、参照素材を権利処理済みの自社アセットに限定し、生成に使ったプロンプトと設定を案件ごとに記録しておくのが安全です。ロゴ、パッケージの文言、価格、成分や効能の表示、法的な注記といった「間違えられない情報」は生成に任せず、編集ソフト側で確定的に載せてください。生成物は完成品ではなく、編集判断が要る 1 テイクとして扱うのが現実的です。
この動画生成AI が向いている仕事
EC の商品紹介。 撮影を組む前に、商品の見せ場、質感の検証、縦型の冒頭カットを試せます。パッケージ文言や価格は生成に任せず、編集で確定的に載せてください。
広告クリエイティブの検討。 複数の切り口を短時間で並べ、社内で方向を決めてから本番撮影に進めます。参照でトーンを揃えれば、案ごとの比較が主観に流れにくくなります。
キャラクター素材と VTuber 向けカット。 正面と側面の参照画像で同一性を保ちながら、振り向きや歩きのカットを作れます。権利処理済みのデザイン画だけを参照に使ってください。
社内・採用向けの説明動画。 環境カットや雰囲気の挿入映像を内製できます。話者の発話が要る箇所は、音の同期と発音を必ず通しで確認してください。
モデルを決める前にワークフローを比べる
モデル名だけでは制作要件に答えられません。英語で公開している実践的な比較記事 MiniMax H3 vs Seedance 2 と MiniMax H3 vs Flux 3 Videoでは、公開されている仕様と不明な点を分け、動き・参照・音声・尺・採用カットあたりの費用を繰り返し検証する方法を扱っています。
そのカットに本当に必要な 情報から始める。
構図を自由に決めたいならテキスト、始点や終点が決まっているならフレーム、人物・動き・音に具体的な基準が要るならマルチモーダル参照から始めてください。
演出し、基準を与え、 通しで確認する。
被写体と動作を先に書き、そのあとに環境、カメラの経路、照明、テンポ、崩してはいけない条件、重要な音を 1〜2 点だけ足します。形容詞を並べるより、優先順位が見える文のほうが結果は安定します。入れたくない要素は否定形で明示してください。
入力方式は 1 つに絞ります。始点や終点の構図が決まっているならフレーム、人物の同一性・動き・リズム・空気感を文章より素材で伝えたいなら参照モードを選びます。両者は 1 回のリクエストで併用できません。
指示の反映、手足や物体の破綻、カメラの連続性、実際に使える秒数、音の同期を確認します。うまくいった設定は保存し、次は変数を 1 つだけ変えて、具体的な制作上の問いに答えさせてください。
明確な演出を、 使える H3 のドラフトへ。
入力方式を選び、4〜15 秒と 768P / 2K を設定して生成し、マイ作品で結果を確認してください。
検証を重ねるためのクレジット。
出力解像度、尺、参照動画の秒数、制作量に合ったプランを選んでください。
Standard
Billed $238.80 yearly
- Commercial Usage RightsYearly Only
- Up to 520 videos
- Video models low to $0.11/s
- Up to 9,360 images
- All AI Models
- Priority Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Business
Billed $418.80 yearly
- Commercial Usage RightsYearly Only
- Up to 1,133 videos
- Video models low to $0.09/s
- Up to 20,400 images
- All AI Models
- Priority Support
- Dedicated Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Enterprise
Billed $898.80 yearly
- Commercial Usage RightsYearly Only
- Up to 3,266 videos
- Video models low to $0.06/s
- Up to 58,800 images
- All AI Models
- Priority Support
- Dedicated Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Included models
Credits activate instantly for MiniMax H3 generation workflows.

きれいな 1 フレームではなく、 テイク全体で判断する。
使える結果とは、人物の同一性・動き・カメラの論理・タイミング・音が最後まで崩れないものです。その設定を次のカットへ持ち込む前に、必ず通しで確認してください。
生成画面を開くMiniMax H3 AI のよくある質問
MiniMax H3 で作った動画は商用利用できますか?
商用利用の可否は、選択した有料プラン、当サービスの利用規約、および上流モデル提供元のルールに従います。無料の体験クレジットで作成した出力を広告や販売物に使う前に、必ず有料プランの条件を確認してください。ロゴ、価格、成分表示、法的表記などの確定情報は生成に任せず、編集段階で追加するのが安全です。
生成した動画の著作権や肖像権はどう扱われますか?
既存の作品や実在の人物に酷似した出力は、プロンプトで意図的にそれらを参照していた場合に依拠性が認められ、著作権侵害や肖像権侵害を問われる可能性があります。特定の作品名・芸能人名・ブランドロゴをプロンプトや参照ファイルに入れないでください。参照画像は、権利処理が済んでいる自社素材だけを使うことを推奨します。
日本語のプロンプトは使えますか?
日本語で入力できます。ただし演出の粒度が精度を左右するため、被写体・動作・カメラの動き・照明・時間配分・音の優先順位を分けて書いてください。「かっこいい映像」のような抽象語だけでは方向が定まりません。生成してほしくない要素は否定形で明示すると、余計な文字や不要な被写体が入り込みにくくなります。
参照ファイルは何をどれだけ入れられますか?
画像は最大 9 点、動画は最大 3 点、音声は最大 3 点で、合計 12 ファイルまでです。動画と音声はそれぞれ 2〜15 秒、同じ種類の合計も 15 秒以内である必要があります。音声だけを参照にすることはできないため、画像か動画を必ず 1 点以上添えてください。ファイルは多いほど良いわけではなく、役割が重複したものは外したほうが安定します。
2K とネイティブ音声はどう違いますか?
2K は解像度の話で、素材の質感や髪、環境の細部を確認したいときに選びます。ネイティブ音声は、映像と音を同時に生成する方式のことで、後から音源を貼り付ける処理とは異なります。ただし「ネイティブ」は生成方法を指す言葉であり、発音・口の動き・音量バランスが完成品の水準であることを保証するものではありません。公開前に必ず通しで確認してください。
MiniMax の公式サイトですか?
いいえ。当サイトは独立した AI 生成サービスであり、MiniMax、ByteDance、Black Forest Labs、Flux をはじめとするいかなるモデル所有者とも、提携・承認・後援の関係はありません。アカウント、クレジット、請求、ファイル、サポートはすべて当サービスが提供します。