Мультимодальная генерация · 4–15 секунд · 768P или 2K
Создавайте из текста, из первого или последнего кадра, из референсных изображений, видео и аудио. Ставьте ролики 24 FPS со встроенным стереозвуком 32 кГц в независимом рабочем пространстве прямо в браузере.
Независимый сервис. Не связан с MiniMax или любым другим владельцем модели и не поддерживается ими.
Руководство по MiniMax H3 / проверено 5 августа 2026
MiniMax H3 AI — это мультимодальная нейросеть для генерации видео, которая учитывает контекст текста, изображения, видео и звука. С её помощью получаются ролики от 4 до 15 секунд в 768P или 2K при 24 FPS со встроенным стереозвуком 32 кГц — из свободного текстового запроса, из первого или последнего кадра либо из подобранного набора визуальных и звуковых референсов.
Если начальный или финальный кадр уже есть, начинать с текста незачем. Режиму «изображение в видео» нужен хотя бы один опорный кадр, а оба сразу имеют смысл, когда переходу нужны две точки привязки. Кадрирование задаёт ваш файл, поэтому соотношение сторон отдельным параметром не отправляется.
Описывайте только то, что меняется во времени: движение камеры, движение тела, реакцию среды, тайминг — и отдельно то, что должно остаться нетронутым. Пересказ всех видимых деталей тратит место в запросе и порождает противоречия. Первый кадр хорошо работает с товарной съёмкой, ключевым визуалом кампании, иллюстрацией или кадром раскадровки; последний даёт контроль над точкой прибытия в сценах раскрытия и превращения.
Когда композицию можно придумать с нуля, начинайте с текста. Полезный запрос читается как режиссёрская экспликация: объект, действие, среда, положение и движение камеры, свет, темп и тот звук, который важнее прочих. Жёсткие требования к непрерывности пишутся раньше декоративного стиля. Шесть фиксированных соотношений сторон закрывают широкий экран, горизонталь, квадрат и вертикаль, а длительность задаётся любым целым числом секунд от четырёх до пятнадцати.
Этот путь подходит для поиска концепции, вертикальных заходов в соцсети и мессенджеры, атмосферных перебивок, товарных сцен и кинематографичного B-roll. Он же честнее всего показывает, понял ли модель текст, — загруженный файл ничего не прикрывает. Сделайте несколько вариантов, запишите точные настройки и выбирайте по пригодным секундам, а не по самой красивой обложке.
Режим референсов принимает до девяти изображений, трёх видео и трёх аудиофайлов — всего двенадцать файлов. Каждый видео- и аудиофайл длится от двух до пятнадцати секунд, суммарная длительность внутри каждого типа тоже не выходит за пятнадцать. Аудио не может быть единственным референсом: добавьте изображение или видео, чтобы у системы была визуальная опора. Давайте каждому файлу ровно одну задачу: одно изображение задаёт внешность, другое — костюм, третье — место; короткое видео показывает ритм камеры, аудио задаёт тайминг, пространство и тембр. Дублирующие и противоречащие друг другу референсы лучше убрать.
768P — режим быстрого поиска, 2K оправдан, когда важны фактура, волосы, материалы или больший формат сдачи. Разрешение не спасает вялую композицию и неустойчивое движение, поэтому направление сцены дешевле подтвердить на экономичных настройках. Встроенный звук создаётся вместе с картинкой, а не подкладывается отдельной дорожкой, поэтому описывайте его физически: расстояние, фактура, тайминг, отклик помещения, синхронный удар или короткая реплика. Перед публикацией всегда проверяйте произношение, попадание в артикуляцию, перегруз, лишнюю музыку, баланс каналов и права на материал.
Карточки товаров и реклама. Проверяйте показ товара, крупные планы фактуры и вертикальные заходы до того, как собирать съёмку. Цену и текст упаковки ставьте на монтаже.
Контент для соцсетей и мессенджеров. Серия коротких вертикальных роликов со звуком, где единый визуальный тон между вариантами держится за счёт референсов.
Превизуализация кампании. Раскадровка превращается в подвижные черновики: удобно сравнить траектории камеры и согласовать направление до расходов на продакшен.
Музыкальные и атмосферные вставки. Средовые планы и перебивки, которые не хочется брать из стокового банка. Управляемые 15 секунд обычно полезнее размашистой сцены, теряющей внешность на середине.
Название модели само по себе не отвечает на бриф. Наши практические сравнения, опубликованные на английском, MiniMax H3 vs Seedance 2 и MiniMax H3 vs Flux 3 Video, отделяют документированные возможности от неизвестного и содержат воспроизводимые тесты движения, референсов, звука, длительности и стоимости одного принятого кадра.
Текст — когда кадр можно придумать с нуля. Опорные кадры — когда начало или финал уже определены. Мультимодальные референсы — когда внешности, движению или звуку нужна конкретная опора.
Сначала напишите объект и действие. Затем добавьте среду, траекторию камеры, свет, темп, требования к непрерывности и один-два важных звука. Понятная иерархия работает намного лучше, чем список прилагательных без порядка.
Выбирайте один способ ввода. Опорные кадры — когда композиция должна начинаться или заканчиваться в известной точке. Режим референсов — когда изображение, видео или звук передают внешность, движение и атмосферу точнее текста.
Оцените соответствие запросу, анатомию, устойчивость объектов, непрерывность камеры, реально пригодные секунды и синхронность звука. Сохраните удачные настройки и меняйте по одной переменной за раз.
Выберите способ ввода, задайте 4–15 секунд и 768P или 2K, сгенерируйте и посмотрите результат в разделе «Мои работы».
Выберите тариф по разрешению, длительности, секундам референсного видео и объёму работы.
Billed $238.80 yearly
Billed $418.80 yearly
Billed $898.80 yearly
Included models
Credits activate instantly for MiniMax H3 generation workflows.

Пригодный результат удерживает вместе внешность, движение, логику камеры, тайминг и звук. Посмотрите ролик полностью, прежде чем переносить эти настройки в следующую сцену.
Открыть генераторДа, через режим первого кадра: вы загружаете снимок и описываете только то, что меняется во времени — движение камеры, блик по материалу, реакцию среды, темп. Кадрирование берётся из вашего изображения, поэтому в этом режиме соотношение сторон отдельным параметром не передаётся. Пересказывать всё, что уже видно на фото, не нужно: это тратит место в запросе и создаёт противоречия.
На платных тарифах водяного знака сервиса нет. Но если на загруженном референсном изображении или видео знак уже есть, нейросеть может воспринять его как часть картинки и воспроизвести. В этом случае нужно заменить референс, а не закрашивать результат на монтаже.
Кредиты зависят от разрешения, длительности ролика, длительности референсных видео и числа изображений сверх первых пяти. Ролик 5 секунд в 768P — около 74 кредитов, в 2K — около 118. Оценка на экране приблизительная: сервер пересчитывает списание по метаданным загруженных файлов.
До девяти изображений, трёх видео и трёх аудиофайлов, но не больше двенадцати файлов суммарно. Каждое видео и аудио должно длиться от 2 до 15 секунд, и суммарная длительность внутри каждого типа тоже не превышает 15 секунд. Аудио не может быть единственным референсом — добавьте хотя бы одно изображение или видео, иначе у модели не будет визуальной опоры.
Нет. Это независимый сервис генерации, не связанный с MiniMax, ByteDance, Black Forest Labs, Flux или любым другим владельцем модели и не поддерживаемый ими. Аккаунт, кредиты, оплата, файлы и поддержка относятся к этому сервису.