Génération multimodale · 4 à 15 secondes · 768P ou 2K

Générateur de vidéo IA MiniMax H3L'image et le son produits dans la même passe

Créez à partir de texte, d'une première ou dernière image, et de références image, vidéo ou audio. Dirigez des plans à 24 FPS avec un son stéréo natif 32 kHz depuis un espace de travail indépendant, dans le navigateur.

Service indépendant. Sans affiliation, approbation ni parrainage de MiniMax ou de tout autre propriétaire de modèle.

142 Credits

Guide MiniMax H3 / vérifié le 5 août 2026

Un flux H3 exploitable, du prompt à la relecture

MiniMax H3 AI est un flux de génération vidéo multimodal qui comprend un contexte texte, image, vidéo et audio. Il produit des plans de 4 à 15 secondes en 768P ou 2K à 24 FPS avec un audio stéréo natif 32 kHz, à partir d'un prompt libre, d'une première ou dernière image, ou d'un ensemble structuré de références visuelles et sonores.

Texte vers vidéo quand le cadre reste à inventer

Partez du texte quand la composition peut être créée de zéro. Un prompt utile se lit comme une note de tournage : sujet, action, décor, position et mouvement de caméra, lumière, rythme, et le son qui compte le plus. Les contraintes de continuité passent avant le style décoratif. Six formats fixes couvrent le panoramique, le paysage, le carré et le vertical, et la durée accepte toute seconde entière de quatre à quinze.

Cette voie convient à l'exploration de concepts, aux accroches pour les réseaux sociaux, aux inserts d'ambiance, aux plans produit et au B-roll cinématographique. C'est aussi le test le plus honnête, puisque aucun fichier téléversé ne masque la compréhension du texte par le modèle. Générez plusieurs versions, notez les réglages exacts et comparez les secondes exploitables plutôt que la vignette la plus flatteuse.

Images clés quand le début ou la fin sont fixés

Le mode image vers vidéo demande au moins une première ou une dernière image ; vous pouvez fournir les deux quand une transition a besoin de deux points d'ancrage. L'image détermine le cadre, donc ce mode n'envoie pas de paramètre de format séparé. Décrivez ce qui évolue dans le temps : trajet de caméra, mouvement du corps, réaction du décor, tempo, et ce qui doit rester intact. Redécrire chaque détail déjà visible consomme de l'espace de prompt et crée des contradictions.

La première image sert à animer un visuel de campagne, une photo produit, une illustration ou une case de storyboard. La dernière donne le contrôle du point d'arrivée pour les révélations et les transformations. Comme le mode images clés et le mode références s'excluent, décidez avant de téléverser si le plan a besoin d'une composition d'arrivée ou d'un contexte plus large d'identité et de mouvement.

Références multimodales et continuité

Le mode références accepte jusqu'à neuf images, trois vidéos et trois fichiers audio, pour douze fichiers au total. Chaque vidéo ou audio dure de deux à quinze secondes, et le cumul par type de média ne dépasse pas quinze secondes. L'audio ne peut pas être la seule référence : joignez au moins une image ou une vidéo pour le contexte visuel.

Donnez une seule fonction à chaque fichier. Une image définit l'identité, une autre le costume, une troisième le lieu. Une vidéo courte montre la cadence de caméra ou un tempo de jeu, l'audio fixe le moment, l'ambiance ou la texture sonore. Plus de fichiers ne veut pas dire meilleur résultat : retirez les références redondantes ou contradictoires et indiquez dans le prompt quelle propriété vient de quelle source.

2K, audio natif et coût réel

Le 768P sert à explorer vite ; le 2K se justifie quand la matière, les cheveux, le détail du décor ou un format de livraison plus grand valent les crédits supplémentaires. La résolution ne rattrape ni un cadre mou ni un mouvement instable : validez l'intention avec un réglage économique avant de dépenser sur la direction finale. Le coût dépend de la durée de sortie, de la durée des vidéos de référence et des images au-delà de la cinquième ; l'estimation affichée est indicative et le serveur recalcule à partir des métadonnées téléversées.

L'audio natif est produit avec l'image plutôt qu'ajouté sous forme de piste séparée. Écrivez le son comme une indication physique : distance, texture, tempo, réverbération de la pièce, un impact synchronisé ou une réplique courte. Avant publication, contrôlez systématiquement la prononciation, la synchronisation labiale, la saturation, une musique non voulue, l'équilibre des canaux et les droits.

Transparence IA et droits d'usage : à régler avant diffusion

Deux points se traitent avant la mise en ligne dans l'Union européenne. D'abord la transparence : depuis le 2 août 2026, le règlement européen sur l'IA impose que les contenus synthétiques soient identifiables comme générés ou manipulés par une IA. Les modalités concrètes dépendent du contexte de diffusion et de votre statut, donc vérifiez vos obligations plutôt que de supposer que le sujet est réglé. Ce site expose un cadre général, pas un conseil juridique.

Ensuite les droits. L'usage commercial dépend de la formule payante retenue, des Conditions d'utilisation et des règles du fournisseur du modèle : un rendu fait avec des crédits d'essai ne part pas directement en campagne. Côté entrée, évitez de nommer une œuvre, une personnalité ou une marque tierce dans le prompt et les fichiers de référence, et limitez ces fichiers à des visuels dont vous détenez les droits. Les logos, prix, mentions de composition et mentions légales s'ajoutent au montage, de façon déterministe.

Où ce flux vidéo IA trouve sa place

Publicité et contenu de marque. Testez révélations produit, études de matière et accroches verticales avant d'engager un tournage. Les logos, prix et mentions légales s'ajoutent au montage.

Prévisualisation narrative. Transformez des cases de storyboard en brouillons animés, comparez les trajets de caméra et l'énergie de jeu avant de décider ce qui sera réellement tourné.

Production indépendante. Composez visuels musicaux, boucles mode, plans d'ambiance et courtes histoires sonores. Un plan de quinze secondes maîtrisé sert souvent mieux qu'une scène ambitieuse qui perd son identité.

Comparez le flux avant de choisir un modèle

Un nom de modèle ne répond pas seul à un brief. Nos comparatifs pratiques, publiés en anglais, MiniMax H3 vs Seedance 2 et MiniMax H3 vs Flux 3 Video, séparent les capacités documentées des inconnues et proposent des tests reproductibles sur le mouvement, les références, l'audio, la durée et le coût par plan retenu.

01 — Points d'entrée

Commencez par l'information dont le plan a réellement besoin.

Le texte quand le cadre peut être inventé, les images clés quand le début ou la fin sont fixés, les références multimodales quand l'identité, le mouvement ou le son ont besoin d'un point d'ancrage concret.

03 — Méthode

Dirigez, ancrez, puis évaluez.

01 / 03
Cadrez

Écrivez d'abord le sujet et l'action. Ajoutez ensuite le décor, le trajet de caméra, la lumière, le rythme, les contraintes de continuité et un ou deux sons importants. Une hiérarchie claire vaut mieux qu'une liste d'adjectifs sans ordre.

02 / 03
Ancrez

Choisissez un seul point d'entrée. Les images clés quand le cadre doit démarrer ou finir à un endroit défini. Le mode références quand l'image, la vidéo ou l'audio transmettent l'identité, le mouvement ou l'atmosphère mieux qu'un texte.

03 / 03
Évaluez

Contrôlez la fidélité au prompt, l'anatomie, la permanence des objets, la continuité de caméra, les secondes réellement exploitables et la synchronisation audio. Gardez ce qui marche et ne changez qu'une variable à la fois.

04 — Créer

Transformez une intention claire en brouillon H3 exploitable.

Choisissez un flux, réglez de 4 à 15 secondes et 768P ou 2K, générez puis vérifiez le rendu dans Mes créations.

05 — Tarifs

Des crédits pour itérer avec méthode.

Choisissez une formule selon la résolution de sortie, la durée, les secondes de vidéo de référence et votre volume de production.

Cancel anytime

Standard

$39.90$19.90/ mo

Billed $238.80 yearly

Save $240/year - 50% Off
9,360
credits
$0.11/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 624 videos
  • Video models low to $0.11/s
  • Up to 9,360 images
  • All AI Models
  • Priority Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only
Most Popular

Business

$69.90$34.90/ mo

Billed $418.80 yearly

Save $420/year - 55% Off
20,400
credits
$0.09/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 1,360 videos
  • Video models low to $0.09/s
  • Up to 20,400 images
  • All AI Models
  • Priority Support
  • Dedicated Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only
Best Value

Enterprise

$124.90$74.90/ mo

Billed $898.80 yearly

Save $600/year - 60% Off
Quantity Adjustment2x
5x Best Value
58,800
credits
$0.06/s
Lowest cost per second
  • Commercial Usage RightsYearly Only
  • Up to 3,920 videos
  • Video models low to $0.06/s
  • Up to 58,800 images
  • All AI Models
  • Priority Support
  • Dedicated Support
  • Priority Processing Speed
  • Remove Watermark
  • Free Video UpscalerYearly Only
  • Free Frame InterpolationYearly Only
  • More Free AI ToolsYearly Only

Included models

Ideogram 4
Z-Image Turbo
Grok Imagine Image
Nano Banana
Nano Banana Pro
Nano Banana 2
GPT Image 2
Seedream 5.0 Lite
Seedream 4.5
MiniMax H3
Seedance 2.0
Seedance 2.0 Fast
Seedance 2.0 Mini
Seedance 2.5Coming SoonGet Early Bird
Seedance 1.5 Pro
Grok Imagine Video
Gemini Omni Flash
Veo 3.1 Quality
Veo 3.1 Lite
Veo 3.1 Fast
Wan 2.7
Wan 2.6
Wan 2.5
Secure checkoutstripe

Credits activate instantly for MiniMax H3 generation workflows.

Free trial credits on signupInstant credit deliveryMiniMax H3 and full model access
Supported payment methods
Mastercard
VISAVisa
AMEXAmerican Express
Apple Pay
Google Pay
linkLink
UnionPay
JCBJCB
DISCOVERDiscover
SEPASEPA
Créateur examinant une prise vidéo MiniMax H3 AI
Note de production

Jugez la prise entière, pas une jolie image.

Un rendu exploitable tient ensemble l'identité, le mouvement, la logique de caméra, le tempo et le son. Visionnez le plan complet avant de reporter ces choix sur une autre scène.

Ouvrir le générateur
06 — Questions

Questions fréquentes sur MiniMax H3 AI

Dois-je signaler que la vidéo a été générée par IA ?

Dans l'Union européenne, le règlement sur l'IA impose depuis le 2 août 2026 une obligation de transparence sur les contenus synthétiques : un contenu généré ou manipulé par IA doit être identifiable comme tel. Les modalités dépendent de votre usage et de votre statut, alors vérifiez vos obligations avant publication. Ce site décrit un cadre général et ne fournit pas de conseil juridique.

Les vidéos comportent-elles un filigrane ?

Les vidéos générées avec une formule payante ne portent pas de filigrane de la plateforme. En revanche, si l'image ou la vidéo de référence que vous téléversez en contient déjà un, le modèle peut apprendre cet élément visuel et le reproduire. Dans ce cas, changez de fichier de référence plutôt que de tenter de le masquer au montage.

Puis-je utiliser les vidéos à des fins commerciales ?

Les droits d'usage commercial dépendent de la formule payante choisie, de nos Conditions d'utilisation et des règles du fournisseur du modèle. Avant de diffuser en campagne un rendu produit avec des crédits d'essai, vérifiez les conditions de votre formule. Les logos, prix, mentions de composition et mentions légales s'ajoutent au montage, jamais à la génération.

Quels fichiers de référence sont acceptés ?

Jusqu'à neuf images, trois vidéos et trois fichiers audio, pour douze fichiers au maximum. Chaque vidéo ou audio doit durer entre 2 et 15 secondes, et le cumul par type de média ne peut pas dépasser 15 secondes non plus. L'audio ne peut pas être la seule référence : ajoutez au moins une image ou une vidéo pour donner un contexte visuel.

Que signifie « audio natif » ?

L'image et le son sont produits ensemble, en stéréo 32 kHz, au lieu d'ajouter une piste séparée après coup. « Natif » décrit toutefois la méthode de génération : cela ne garantit ni la prononciation, ni la synchronisation labiale, ni l'équilibre des canaux au niveau d'une livraison finale. Visionnez le plan entier avant publication.

Est-ce le site officiel de MiniMax ?

Non. Ce site est un service de génération indépendant, sans affiliation, approbation ni parrainage de MiniMax, ByteDance, Black Forest Labs, Flux ou de tout autre propriétaire de modèle. Votre compte, vos crédits, la facturation, vos fichiers et le support relèvent de ce service.