Generación multimodal · 4 a 15 segundos · 768P o 2K

Generador de vídeo con IA MiniMax H3Imagen y sonido generados a la vez

Crea a partir de texto, del primer o del último fotograma y de referencias de imagen, vídeo o audio. Dirige clips a 24 FPS con sonido estéreo nativo de 32 kHz desde un único espacio de trabajo en el navegador.

Servicio independiente. No está afiliado, respaldado ni patrocinado por MiniMax ni por ningún propietario de modelo.

142 Credits

Guía de MiniMax H3 / verificada el 5 de agosto de 2026

Un flujo H3 práctico, del prompt a la revisión

MiniMax H3 AI es un flujo de generación de vídeo multimodal que entiende contexto de texto, imagen, vídeo y audio. Permite crear clips de 4 a 15 segundos en 768P o 2K a 24 FPS con audio estéreo nativo de 32 kHz, partiendo de un prompt abierto, del primer o último fotograma, o de un conjunto estructurado de referencias visuales y sonoras.

Texto a vídeo cuando la composición parte de cero

Empieza por texto cuando el encuadre se pueda inventar. Un prompt útil se lee como una indicación de rodaje: sujeto, acción, entorno, posición y movimiento de cámara, luz, ritmo y el sonido que más importa. Las condiciones de continuidad que no se pueden romper van antes que el estilo decorativo. Seis proporciones fijas cubren panorámico, horizontal, cuadrado y vertical, y la duración admite cualquier segundo entero entre cuatro y quince.

Esta vía sirve para explorar conceptos, ganchos para redes sociales, insertos de ambiente, momentos de producto y B-roll cinematográfico. También es la prueba más limpia, porque ningún archivo subido tapa si el modelo entendió el texto. Genera varias versiones, anota los ajustes exactos y compara segundos aprovechables en lugar de quedarte con la miniatura más atractiva.

Fotogramas cuando el inicio o el final ya están decididos

El modo imagen a vídeo necesita al menos un primer o un último fotograma; puedes dar los dos cuando una transición requiere dos anclajes. El fotograma decide la composición, así que este modo no envía un parámetro de proporción aparte. Describe lo que cambia con el tiempo: recorrido de cámara, movimiento del cuerpo, respuesta del entorno, tempo y qué debe permanecer intacto. Repetir cada detalle visible gasta espacio de prompt y genera contradicciones.

El primer fotograma sirve para animar un arte clave de campaña, una foto de producto, una ilustración o una viñeta de storyboard. El último añade control del destino en revelaciones y transformaciones. Como el modo de fotogramas y el de referencias son excluyentes, decide antes de subir archivos si el plano necesita composición final o un contexto más amplio de identidad y movimiento.

Referencias multimodales para mantener la continuidad

El flujo de referencias admite hasta nueve imágenes, tres vídeos y tres audios, con doce archivos como máximo. Cada clip de vídeo o audio debe durar entre dos y quince segundos, y la duración total dentro de cada tipo de medio no puede superar los quince. El audio no puede ser la única referencia: incluye al menos una imagen o un vídeo para dar contexto visual.

Asigna a cada archivo una sola función. Una imagen puede definir la identidad, otra el vestuario y otra la localización. Un vídeo corto muestra el ritmo de cámara o un tempo de interpretación, y el audio establece el momento, el ambiente o la textura tonal. Más archivos no es automáticamente mejor: quita las referencias redundantes o contradictorias e indica en el prompt qué propiedad debe venir de qué fuente.

Detalle en 2K, audio nativo y coste real

Usa 768P para explorar rápido y 2K cuando la textura fina, el pelo, los materiales, el detalle del entorno o un formato de entrega mayor justifiquen los créditos extra. La resolución no rescata una composición floja ni un movimiento inestable, así que confirma el plano con un ajuste económico antes de gastar más en la dirección final. El coste se calcula por duración de salida, duración del vídeo de referencia e imágenes a partir de la sexta; la estimación en pantalla es orientativa y el servidor recalcula con los metadatos subidos.

El audio nativo se genera junto a la imagen en lugar de añadirse como pista de archivo. Escribe el sonido como una indicación física: distancia, textura, tempo, tono de sala, un impacto sincronizado o una frase hablada. Antes de publicar, comprueba siempre pronunciación, sincronía labial, saturación, música no deseada, balance de canales y derechos. «Nativo» describe el método de generación, no garantiza una mezcla terminada.

Dónde encaja este flujo de vídeo con IA

Comercio electrónico y redes sociales. Prueba revelaciones de producto, estudios de textura y ganchos verticales antes de montar un rodaje. Los logotipos, el texto del envase y los precios se añaden en la edición, no se generan.

Conceptos publicitarios. Pon varias direcciones una al lado de otra en poco tiempo y unifica el tono con referencias, para que la decisión interna no dependa solo de la intuición.

Previsualización narrativa. Convierte viñetas de storyboard en borradores en movimiento, prueba recorridos de cámara y compara la energía de la interpretación antes de decidir qué se rueda de verdad.

Compara el flujo antes de elegir modelo

El nombre de un modelo no responde por sí solo a un briefing. Nuestras comparativas prácticas, publicadas en inglés, MiniMax H3 vs Seedance 2 y MiniMax H3 vs Flux 3 Video, separan las capacidades documentadas de las incógnitas e incluyen pruebas repetibles de movimiento, referencias, audio, duración y coste por plano aprobado.

01 — Vías de entrada

Empieza por la información que ese plano necesita.

Usa texto cuando la composición se pueda inventar, fotogramas cuando el principio o el final ya estén decididos, y referencias multimodales cuando la identidad, el movimiento o el sonido necesiten un anclaje concreto.

03 — Flujo de trabajo

Dirige, ancla y luego revisa.

01 / 03
Define

Escribe primero el sujeto y la acción. Después añade entorno, recorrido de cámara, luz, ritmo, condiciones de continuidad y uno o dos sonidos importantes. Una jerarquía clara funciona mucho mejor que una lista de adjetivos sin orden.

02 / 03
Ancla

Elige una sola vía de entrada. Usa fotogramas cuando la composición deba empezar o terminar en un punto conocido. Usa el modo de referencias cuando las imágenes, el vídeo o el audio comuniquen identidad, movimiento o atmósfera mejor que el texto.

03 / 03
Evalúa

Comprueba la fidelidad al prompt, la anatomía, la permanencia de los objetos, la continuidad de cámara, los segundos realmente utilizables y la sincronía del audio. Conserva lo que funcionó y cambia una sola variable cada vez.

04 — Crear

Convierte una dirección clara en un borrador H3 utilizable.

Elige un flujo, ajusta de 4 a 15 segundos y 768P o 2K, genera y revisa el resultado en Mis creaciones.

05 — Precios

Créditos para iterar con criterio.

Elige un plan según la resolución de salida, la duración, los segundos de vídeo de referencia y tu volumen de producción.

Cancel anytime

Standard

$39.90$19.90/ mo

Billed $238.80 yearly

Save $240/year - 50% Off
9,360
credits
$0.11/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 624 videos
  • Video models low to $0.11/s
  • Up to 9,360 images
  • All AI Models
  • Priority Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only
Most Popular

Business

$69.90$34.90/ mo

Billed $418.80 yearly

Save $420/year - 55% Off
20,400
credits
$0.09/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 1,360 videos
  • Video models low to $0.09/s
  • Up to 20,400 images
  • All AI Models
  • Priority Support
  • Dedicated Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only
Best Value

Enterprise

$124.90$74.90/ mo

Billed $898.80 yearly

Save $600/year - 60% Off
Quantity Adjustment2x
5x Best Value
58,800
credits
$0.06/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 3,920 videos
  • Video models low to $0.06/s
  • Up to 58,800 images
  • All AI Models
  • Priority Support
  • Dedicated Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only

Included models

Ideogram 4
Z-Image Turbo
Grok Imagine Image
Nano Banana
Nano Banana Pro
Nano Banana 2
GPT Image 2
Seedream 5.0 Lite
Seedream 4.5
MiniMax H3
Seedance 2.0
Seedance 2.0 Fast
Seedance 2.0 Mini
Seedance 2.5Coming SoonGet Early Bird
Seedance 1.5 Pro
Grok Imagine Video
Gemini Omni Flash
Veo 3.1 Quality
Veo 3.1 Lite
Veo 3.1 Fast
Wan 2.7
Wan 2.6
Wan 2.5
Secure checkoutstripe

Credits activate instantly for MiniMax H3 generation workflows.

Free trial credits on signupInstant credit deliveryMiniMax H3 and full model access
Supported payment methods
Mastercard
VISAVisa
AMEXAmerican Express
Apple Pay
Google Pay
linkLink
UnionPay
JCBJCB
DISCOVERDiscover
SEPASEPA
Creador revisando una toma de vídeo con MiniMax H3 AI
Nota de producción

Juzga la toma completa, no un fotograma bonito.

Un resultado útil mantiene juntas la identidad, el movimiento, la lógica de cámara, el tempo y el sonido. Revisa el clip entero antes de llevar esas decisiones a otra escena.

Abrir el generador
06 — Preguntas

Preguntas frecuentes sobre MiniMax H3 AI

¿Los vídeos llevan marca de agua?

Los vídeos generados con un plan de pago no llevan marca de agua de la plataforma. Si subes una imagen o un vídeo de referencia que ya tiene una marca de agua, el modelo puede aprender ese elemento visual e incorporarlo al resultado. En ese caso hay que cambiar el material de referencia, no intentar taparlo en la edición.

¿Puedo usar los vídeos con fines comerciales?

Los derechos de uso comercial dependen del plan de pago elegido, de nuestros Términos de Servicio y de las reglas del proveedor del modelo. Antes de llevar a una campaña algo creado con créditos de prueba, revisa las condiciones del plan. Los logotipos, los precios, el texto del envase y los avisos legales conviene añadirlos en la edición, no generarlos.

¿Cuánto dura un vídeo y qué formatos hay?

La duración va de 4 a 15 segundos, en segundos enteros, a 24 FPS. Hay seis proporciones fijas que cubren panorámico, horizontal, cuadrado y vertical, así que puedes preparar la misma idea para YouTube y para formatos verticales sin recortar a mano. La resolución de salida es 768P o 2K.

¿Qué archivos de referencia acepta?

Hasta nueve imágenes, tres vídeos y tres audios, con un máximo de doce archivos en total. Cada vídeo o audio debe durar entre 2 y 15 segundos, y la suma dentro de cada tipo de medio tampoco puede pasar de 15 segundos. El audio no puede ser la única referencia: añade al menos una imagen o un vídeo para dar contexto visual.

¿Qué significa audio nativo?

Significa que la imagen y el sonido se generan a la vez, en lugar de pegar una pista de archivo al final. El audio es estéreo a 32 kHz. Aun así, «nativo» describe el método de generación y no garantiza que la pronunciación, la sincronía labial o el balance de canales lleguen a nivel de entrega. Revisa el clip completo antes de publicar.

¿Es la web oficial de MiniMax?

No. Este sitio es un servicio de generación independiente y no está afiliado, respaldado ni patrocinado por MiniMax, ByteDance, Black Forest Labs, Flux ni ningún propietario de modelo. Tu cuenta, tus créditos, la facturación, los archivos y el soporte son de este servicio.