多模态视频生成 · 4~15 秒 · 768P 或 2K
MiniMax H3 AI 视频生成文生、图生、参考生成,画面与声音一次出
从文字、首帧或尾帧,以及图片、视频、音频参考开始。在一个独立的网页工作区里,导出 24 FPS、自带 32 kHz 立体声原生音频的片段。
独立服务,非 MiniMax 官方站点。与 MiniMax 及任何模型所有者均无隶属、背书或赞助关系。
MiniMax H3 指南 / 2026 年 8 月 5 日校订
从提示词到验收,一套能复用的 H3 流程
MiniMax H3 AI 是一套能同时理解文字、图片、视频和音频上下文的多模态视频生成流程。 你可以用开放式提示词、首帧或尾帧,或者一组结构化的视觉与声音参考,生成 4~15 秒、768P 或 2K、24 FPS,并自带 32 kHz 立体声原生音频的片段。
文生视频:构图从零开始时最划算
构图可以自己发明时就用文生视频。可用的提示词读起来像分镜指示:主体、动作、环境、机位与运镜、光线、节奏,以及最重要的那个声音。必须守住的连续性条件要写在装饰性风格前面。六种固定画幅覆盖宽屏、横版、方形和竖版,时长是 4 到 15 秒之间的任意整秒。
这条路径适合概念摸索、社媒开头钩子、氛围插入镜头、商品镜头和电影感 B-roll。因为没有上传素材兜底,它也是最干净的对比测试方式:模型有没有读懂那段文字,一眼就能看出来。多生成几版、把设置记下来,然后按「实际可用的秒数」挑,而不是挑封面最好看的那一版。
图生视频:起点或终点已经定了
图生视频至少需要一张首帧或尾帧;一段转场需要两个定位点时,两张都给也可以。画面由这张图决定,所以这个模式不再单独传画幅参数。要描述的是时间轴上的变化:运镜移动、身体动作、环境反应、时间点,以及哪些必须保持不动。把画面上已经看得见的细节再写一遍,只会占用提示词空间并制造冲突。
首帧适合让主视觉、商品图、插画或一格分镜动起来;尾帧多用在揭示和变形这类需要控制「终点」的镜头。由于首尾帧模式与多模态参考互斥,上传文件之前先决定:这条镜头要的是终点构图,还是更宽的人物一致性与运动上下文。
多模态参考:让人物和节奏不跑偏
参考模式最多接受 9 张图片、3 段视频、3 段音频,合计 12 个文件。视频和音频各自需在 2 到 15 秒之间,同类媒体的总时长也不能超过 15 秒。音频不能作为唯一参考,请至少搭一张图片或一段视频,让系统有视觉依据。
关键是给每个文件只派一个活:一张定人物、一张定服装、一张定场景;短视频示范运镜律动或表演节拍,音频交代时间点、空间感和音色。正面加侧面的人物参考图,能明显提高发色、服装和面部特征的稳定度。但文件不是越多越好,重复或互相矛盾的参考要删掉,并在提示词里写明哪个属性取自哪个来源。
2K、原生音频与积分怎么花
快速摸索用 768P,需要看清材质、发丝、环境细节或交付尺寸更大时再上 2K。分辨率救不了松散的构图和不稳的动作,先用便宜设置把方向定下来更划算。积分按输出时长、参考视频时长以及第六张起的图片计算;页面预估只是参考值,服务器会按上传文件的元数据重新算一遍。
原生音频是和画面一起生成的,不是事后贴一条素材音轨。写声音时按物理指令写:距离、质地、时间点、房间残响、一次同步的撞击,或者一句短台词。发布前务必检查发音、口型、爆音、非预期配乐、左右声道平衡和授权状态。「原生」说的是生成方式,不等于交付级的混音成品。
这套流程适合哪些活
电商与短视频投流。 正式开拍前先试商品揭示、材质特写和竖版开头钩子。品牌标识、包装文案、价格请在剪辑环节确定性地加上。
广告创意初稿。 短时间把几个方向并排比较,用参考素材统一调性,让内部评审不必只凭感觉。
分镜预演。 把分镜画稿变成能动的草稿,测试运镜路径和表演强度,再决定哪一条值得实拍。
自媒体与音乐视觉。 做环境镜头、氛围插入和带声音的短故事。一条控制得住的 15 秒,通常比中途跑偏的长镜头更有用。
选模型之前,先比流程
光看模型名字回答不了制作需求。我们用英文写的实测对比 MiniMax H3 vs Seedance 2 和 MiniMax H3 vs Flux 3 Video把已公开能力和未知项分开,并给出运动、参考、音频、时长以及「每条可用镜头成本」的可复现测试方法。
从这个镜头真正需要的 信息开始。
构图可以自由发挥就用文字,起点或终点已经确定就用首尾帧,人物、动作或声音需要具体依据时再用多模态参考。
先导戏、再给依据, 最后整条验收。
先写主体和动作,再补环境、运镜路径、光线、节奏、必须保持的连续性条件,以及一两个关键声音。有优先级的提示词,效果远好过堆一串形容词。不想出现的元素直接写成否定句。
一次只选一种输入方式。起点或终点构图已经定了就用首尾帧;人物一致性、动作、节奏或氛围用文件比用文字更准,就改用参考模式。两者在同一次请求中不能并用。
检查提示词是否被吃进去、肢体与物体有没有崩、运镜是否连续、实际可用的秒数,以及声音是否对得上。留下有效设置,下一次只改一个变量,让每次生成都在回答一个具体问题。
把明确的分镜想法, 变成可用的 H3 初稿。
选一种输入方式,设定 4~15 秒和 768P 或 2K,生成后到「我的作品」查看结果。
为反复试验准备的积分。
按输出分辨率、时长、参考视频秒数和产出量挑选方案。
Standard
Billed $238.80 yearly
- Commercial Usage RightsYearly Only
- Up to 624 videos
- Video models low to $0.11/s
- Up to 9,360 images
- All AI Models
- Priority Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Business
Billed $418.80 yearly
- Commercial Usage RightsYearly Only
- Up to 1,360 videos
- Video models low to $0.09/s
- Up to 20,400 images
- All AI Models
- Priority Support
- Dedicated Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Enterprise
Billed $898.80 yearly
- Commercial Usage RightsYearly Only
- Up to 3,920 videos
- Video models low to $0.06/s
- Up to 58,800 images
- All AI Models
- Priority Support
- Dedicated Support
- Priority Processing Speed
- Remove Watermark
- Free Video UpscalerYearly Only
- Free Frame InterpolationYearly Only
- More Free AI ToolsYearly Only
Included models
Credits activate instantly for MiniMax H3 generation workflows.

MiniMax H3 AI 常见问题
这里是 MiniMax 官方网站吗?
不是。本站是独立的 AI 生成服务,与 MiniMax、ByteDance、Black Forest Labs、Flux 或任何模型所有者均无隶属、背书或赞助关系。你的账号、积分、账单、文件和客服关系都在本站,与任何厂商官方产品线相互独立。
积分是怎么算的?
积分随分辨率、输出时长、参考视频时长以及超出前五张的图片数量变化。5 秒 768P 约 74 积分,5 秒 2K 约 118 积分,时长按秒线性叠加。页面上的预估只是参考值,服务器会根据你实际上传文件的元数据重新计算后再扣除。
输出的视频带水印吗?
本站付费方案产出的视频不带平台水印。但如果你的参考图或参考视频本身含有水印,模型可能把这个视觉特征学进画面,这种情况要换掉参考素材,而不是靠后期涂抹。
文生视频和图生视频怎么选?
构图可以从零开始就用文生视频,六种固定画幅覆盖横版、方形和竖版,时长 4 到 15 秒任意整秒。起点或终点画面已经定了就用图生视频(首帧/尾帧):画幅由那张图决定,所以这个模式不再单独传画幅参数。两者与多模态参考模式在同一次请求中互斥,只能三选一。
参考文件能传多少?
最多 9 张图片、3 段视频、3 段音频,合计不超过 12 个文件。视频和音频各自需在 2 到 15 秒之间,同类媒体的总时长也不能超过 15 秒。音频不能作为唯一参考,必须至少搭配一张图片或一段视频,否则模型没有视觉依据。
生成的视频可以商用吗?
商用权利取决于你选择的付费方案、本站服务条款以及上游模型提供方的规则。用体验积分产出的素材,投放前请先确认付费方案条件。品牌标识、包装文案、价格、成分与功效表述这类不能出错的信息,请在剪辑环节确定性地加上,不要交给模型生成。