多模态视频生成 · 4~15 秒 · 768P 或 2K

MiniMax H3 AI 视频生成文生、图生、参考生成,画面与声音一次出

从文字、首帧或尾帧,以及图片、视频、音频参考开始。在一个独立的网页工作区里,导出 24 FPS、自带 32 kHz 立体声原生音频的片段。

独立服务,非 MiniMax 官方站点。与 MiniMax 及任何模型所有者均无隶属、背书或赞助关系。

142 Credits

MiniMax H3 指南 / 2026 年 8 月 5 日校订

从提示词到验收,一套能复用的 H3 流程

MiniMax H3 AI 是一套能同时理解文字、图片、视频和音频上下文的多模态视频生成流程。 你可以用开放式提示词、首帧或尾帧,或者一组结构化的视觉与声音参考,生成 4~15 秒、768P 或 2K、24 FPS,并自带 32 kHz 立体声原生音频的片段。

文生视频:构图从零开始时最划算

构图可以自己发明时就用文生视频。可用的提示词读起来像分镜指示:主体、动作、环境、机位与运镜、光线、节奏,以及最重要的那个声音。必须守住的连续性条件要写在装饰性风格前面。六种固定画幅覆盖宽屏、横版、方形和竖版,时长是 4 到 15 秒之间的任意整秒。

这条路径适合概念摸索、社媒开头钩子、氛围插入镜头、商品镜头和电影感 B-roll。因为没有上传素材兜底,它也是最干净的对比测试方式:模型有没有读懂那段文字,一眼就能看出来。多生成几版、把设置记下来,然后按「实际可用的秒数」挑,而不是挑封面最好看的那一版。

图生视频:起点或终点已经定了

图生视频至少需要一张首帧或尾帧;一段转场需要两个定位点时,两张都给也可以。画面由这张图决定,所以这个模式不再单独传画幅参数。要描述的是时间轴上的变化:运镜移动、身体动作、环境反应、时间点,以及哪些必须保持不动。把画面上已经看得见的细节再写一遍,只会占用提示词空间并制造冲突。

首帧适合让主视觉、商品图、插画或一格分镜动起来;尾帧多用在揭示和变形这类需要控制「终点」的镜头。由于首尾帧模式与多模态参考互斥,上传文件之前先决定:这条镜头要的是终点构图,还是更宽的人物一致性与运动上下文。

多模态参考:让人物和节奏不跑偏

参考模式最多接受 9 张图片、3 段视频、3 段音频,合计 12 个文件。视频和音频各自需在 2 到 15 秒之间,同类媒体的总时长也不能超过 15 秒。音频不能作为唯一参考,请至少搭一张图片或一段视频,让系统有视觉依据。

关键是给每个文件只派一个活:一张定人物、一张定服装、一张定场景;短视频示范运镜律动或表演节拍,音频交代时间点、空间感和音色。正面加侧面的人物参考图,能明显提高发色、服装和面部特征的稳定度。但文件不是越多越好,重复或互相矛盾的参考要删掉,并在提示词里写明哪个属性取自哪个来源。

2K、原生音频与积分怎么花

快速摸索用 768P,需要看清材质、发丝、环境细节或交付尺寸更大时再上 2K。分辨率救不了松散的构图和不稳的动作,先用便宜设置把方向定下来更划算。积分按输出时长、参考视频时长以及第六张起的图片计算;页面预估只是参考值,服务器会按上传文件的元数据重新算一遍。

原生音频是和画面一起生成的,不是事后贴一条素材音轨。写声音时按物理指令写:距离、质地、时间点、房间残响、一次同步的撞击,或者一句短台词。发布前务必检查发音、口型、爆音、非预期配乐、左右声道平衡和授权状态。「原生」说的是生成方式,不等于交付级的混音成品。

这套流程适合哪些活

电商与短视频投流。 正式开拍前先试商品揭示、材质特写和竖版开头钩子。品牌标识、包装文案、价格请在剪辑环节确定性地加上。

广告创意初稿。 短时间把几个方向并排比较,用参考素材统一调性,让内部评审不必只凭感觉。

分镜预演。 把分镜画稿变成能动的草稿,测试运镜路径和表演强度,再决定哪一条值得实拍。

自媒体与音乐视觉。 做环境镜头、氛围插入和带声音的短故事。一条控制得住的 15 秒,通常比中途跑偏的长镜头更有用。

选模型之前,先比流程

光看模型名字回答不了制作需求。我们用英文写的实测对比 MiniMax H3 vs Seedance 2 MiniMax H3 vs Flux 3 Video把已公开能力和未知项分开,并给出运动、参考、音频、时长以及「每条可用镜头成本」的可复现测试方法。

01 — 输入方式

从这个镜头真正需要的 信息开始。

构图可以自由发挥就用文字,起点或终点已经确定就用首尾帧,人物、动作或声音需要具体依据时再用多模态参考。

03 — 流程

先导戏、再给依据, 最后整条验收。

01 / 03
写清楚

先写主体和动作,再补环境、运镜路径、光线、节奏、必须保持的连续性条件,以及一两个关键声音。有优先级的提示词,效果远好过堆一串形容词。不想出现的元素直接写成否定句。

02 / 03
给依据

一次只选一种输入方式。起点或终点构图已经定了就用首尾帧;人物一致性、动作、节奏或氛围用文件比用文字更准,就改用参考模式。两者在同一次请求中不能并用。

03 / 03
验收

检查提示词是否被吃进去、肢体与物体有没有崩、运镜是否连续、实际可用的秒数,以及声音是否对得上。留下有效设置,下一次只改一个变量,让每次生成都在回答一个具体问题。

04 — 开始生成

把明确的分镜想法, 变成可用的 H3 初稿。

选一种输入方式,设定 4~15 秒和 768P 或 2K,生成后到「我的作品」查看结果。

05 — 价格

为反复试验准备的积分。

按输出分辨率、时长、参考视频秒数和产出量挑选方案。

Cancel anytime

Standard

$39.90$19.90/ mo

Billed $238.80 yearly

Save $240/year - 50% Off
9,360
credits
$0.11/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 624 videos
  • Video models low to $0.11/s
  • Up to 9,360 images
  • All AI Models
  • Priority Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only
Most Popular

Business

$69.90$34.90/ mo

Billed $418.80 yearly

Save $420/year - 55% Off
20,400
credits
$0.09/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 1,360 videos
  • Video models low to $0.09/s
  • Up to 20,400 images
  • All AI Models
  • Priority Support
  • Dedicated Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only
Best Value

Enterprise

$124.90$74.90/ mo

Billed $898.80 yearly

Save $600/year - 60% Off
Quantity Adjustment2x
5x Best Value
58,800
credits
$0.06/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 3,920 videos
  • Video models low to $0.06/s
  • Up to 58,800 images
  • All AI Models
  • Priority Support
  • Dedicated Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only

Included models

Ideogram 4
Z-Image Turbo
Grok Imagine Image
Nano Banana
Nano Banana Pro
Nano Banana 2
GPT Image 2
Seedream 5.0 Lite
Seedream 4.5
MiniMax H3
Seedance 2.0
Seedance 2.0 Fast
Seedance 2.0 Mini
Seedance 2.5Coming SoonGet Early Bird
Seedance 1.5 Pro
Grok Imagine Video
Gemini Omni Flash
Veo 3.1 Quality
Veo 3.1 Lite
Veo 3.1 Fast
Wan 2.7
Wan 2.6
Wan 2.5
Secure checkoutstripe

Credits activate instantly for MiniMax H3 generation workflows.

Free trial credits on signupInstant credit deliveryMiniMax H3 and full model access
Supported payment methods
Mastercard
VISAVisa
AMEXAmerican Express
Apple Pay
Google Pay
linkLink
UnionPay
JCBJCB
DISCOVERDiscover
SEPASEPA
创作者正在检查 MiniMax H3 AI 视频成片
制作笔记

要看的是整条, 不是好看的那一帧。

可用的结果,是人物一致性、动作、运镜逻辑、时间点和声音能一路撑到最后的那一条。把设置沿用到下一个场景之前,先整条看完。

打开生成器
06 — 常见问题

MiniMax H3 AI 常见问题

这里是 MiniMax 官方网站吗?

不是。本站是独立的 AI 生成服务,与 MiniMax、ByteDance、Black Forest Labs、Flux 或任何模型所有者均无隶属、背书或赞助关系。你的账号、积分、账单、文件和客服关系都在本站,与任何厂商官方产品线相互独立。

积分是怎么算的?

积分随分辨率、输出时长、参考视频时长以及超出前五张的图片数量变化。5 秒 768P 约 74 积分,5 秒 2K 约 118 积分,时长按秒线性叠加。页面上的预估只是参考值,服务器会根据你实际上传文件的元数据重新计算后再扣除。

输出的视频带水印吗?

本站付费方案产出的视频不带平台水印。但如果你的参考图或参考视频本身含有水印,模型可能把这个视觉特征学进画面,这种情况要换掉参考素材,而不是靠后期涂抹。

文生视频和图生视频怎么选?

构图可以从零开始就用文生视频,六种固定画幅覆盖横版、方形和竖版,时长 4 到 15 秒任意整秒。起点或终点画面已经定了就用图生视频(首帧/尾帧):画幅由那张图决定,所以这个模式不再单独传画幅参数。两者与多模态参考模式在同一次请求中互斥,只能三选一。

参考文件能传多少?

最多 9 张图片、3 段视频、3 段音频,合计不超过 12 个文件。视频和音频各自需在 2 到 15 秒之间,同类媒体的总时长也不能超过 15 秒。音频不能作为唯一参考,必须至少搭配一张图片或一段视频,否则模型没有视觉依据。

生成的视频可以商用吗?

商用权利取决于你选择的付费方案、本站服务条款以及上游模型提供方的规则。用体验积分产出的素材,投放前请先确认付费方案条件。品牌标识、包装文案、价格、成分与功效表述这类不能出错的信息,请在剪辑环节确定性地加上,不要交给模型生成。