MiniMax H3 en profondeur : poids ouverts, prix, qualité et rupture
Rapport vérifié sur l'architecture et la licence des poids ouverts de MiniMax H3, les tarifs API, les préférences aveugles, l'auto-hébergement et la comparaison avec Seedance 2.5 et d'autres modèles vidéo.
MiniMax H3 compte parmi les rares modèles vidéo de 2026 qui déplacent à la fois la frontière de qualité et la capacité à modifier la pile. Il accepte texte, images, vidéo et audio dans un même contexte, génère 4 à 15 secondes avec audio stéréo natif, propose des parcours 768P et 2K, et publie des checkpoints H3-Base téléchargeables.
La conclusion rigoureuse est plus précise que « H3 est open source et bat les modèles fermés ». H3 est un modèle à poids ouverts de niveau frontière, avec une API au tarif très agressif ; ce n'est toutefois pas un système d'IA open source complet au sens de l'OSI, et les préférences aveugles actuelles ne démontrent pas une victoire universelle sur Seedance 2.5. Seedance 2.5 conserve un contrat plus large pour des récits de 30 secondes en une passe et de très grands tableaux de références. H3 bouleverse le marché en réunissant qualité de pointe, droits de modification et faible coût hébergé.
Les spécifications, la licence, les tarifs API et la disponibilité Modelflare ont été revérifiés le 30 août 2026. Les instantanés Arena datent des 25–26 août 2026 et évolueront avec les votes.
Verdict exécutif
- Ouverture : H3 publie deux checkpoints de base BF16 spécialisés, les composants du modèle et des recettes SGLang, vLLM, diffusers et ComfyUI. Il s'agit d'une livraison exécutable, pas d'une simple promesse de publication.
- Prix : MiniMax affiche $0.08 par seconde générée en 768P et $0.13 en 2K. Des poids ouverts ne rendent pas l'inférence gratuite : la facture passe de l'API aux GPU, aux opérations, au stockage et à l'ingénierie.
- Résultat : Arena place H3 et Seedance 2.5 dans des groupes de tête qui se chevauchent. H3 mène l'instantané image-vers-vidéo ; Seedance est légèrement devant en texte-vers-vidéo et montage, mais les intervalles se recouvrent dans les trois cas.
- Rupture : H3 réduit fortement l'écart historique entre modèles téléchargeables et modèles fermés de pointe. H3 Max, apparu quelques semaines plus tard, montre que des tiers peuvent modifier le modèle lui-même.
- Réserve : le parcours officiel 2K utilise encore H3-Context-IR et H3-Regenerate-2K hébergés ; la licence communautaire comporte des conditions territoriales, d'usage, de divulgation, d'attribution et de grande exploitation commerciale.
Ce que MiniMax H3 livre réellement
| Élément | Contrat H3 vérifié |
|---|---|
| ID officiel du modèle API | MiniMax-H3 |
| Durée de sortie | 4–15 secondes, valeurs entières |
| Sortie | Vidéo 24 FPS avec audio stéréo 32 kHz |
| Résolution | Base 768P ; 2K via le parcours officiel de génération ou régénération |
| Première/dernière image | Zéro, une ou deux images |
| Références | Jusqu'à 9 images, 3 vidéos et 3 audios ; 12 fichiers au total |
| Durée des références | Chaque vidéo ou audio dure 2–15 secondes ; chaque modalité totalise au plus 15 secondes |
| Dialogue | Support stable annoncé pour 11 langues |
| Checkpoints ouverts | FL2VA pour texte et première/dernière image ; Ref2VA pour références multimodales |
| Générateur central | H3-Omni-Transformer dense 33B, encodeur Qwen3-VL-32B, VAE visuel et audio |
| Runtimes recommandés | SGLang, vLLM, diffusers et ComfyUI |
L'API expose un nom, mais le paquet ouvert contient deux checkpoints de base spécialisés. Une équipe qui sert à la fois première/dernière image et références multimodales arbitraires doit prévoir stockage et capacité pour les deux parcours.
Audit d'ouverture : quatre couches, pas une étiquette
| Couche | Partie ouverte | Limites restantes | Lecture pratique |
|---|---|---|---|
| Poids et composants d'inférence | Familles H3-Base, processeur, tokenizer, encodeur, Omni Transformer, VisualVAE et AudioVAE | Dépôt volumineux et capacité GPU importante en production | Exécution locale et fine-tuning réellement possibles |
| Écosystème runtime | Recettes officielles pour quatre runtimes, exemples téléchargeables et cas 768P reproductibles | Version initiale en full attention ; sparse attention annoncée plus tard | Surface d'ingénierie utile, pas encore sous sa forme la plus efficace |
| Chaîne produit complète | H3-Base local produit de l'audio-vidéo 768P | H3-Context-IR est hébergé ; le 2K officiel appelle Context-IR et les API de régénération | Le meilleur parcours officiel est hybride, non totalement local |
| Licence et reproductibilité | Modification, dérivés, redistribution et de nombreux usages commerciaux dans le territoire applicable | Licence sur mesure, territoires exclus, restrictions d'usage, divulgation, autorisation au-delà de $20M de revenus et paquet d'entraînement incomplet | « Poids ouverts sous licence communautaire » est plus exact que « entièrement open source » sans condition |
L'Open Source AI Definition exige la liberté d'utiliser, étudier, modifier et partager à toute fin, ainsi que la forme privilégiée de modification, avec suffisamment d'informations sur les données et le code d'entraînement. Les restrictions territoriales et d'usage de H3 et son paquet incomplet n'atteignent pas ce seuil.
Cela ne minimise pas l'apport. Publier une base vidéo de pointe avec de vrais droits de modification et redistribution est majeur. La formulation précise évite seulement de confondre poids téléchargeables et droits universels de déploiement.
Architecture de H3 et intérêt pratique
H3 regroupe les modalités dans une séquence. Le texte passe par l'encodeur H3, les entrées visuelles par l'encodeur et VisualVAE, l'audio par AudioVAE. Un Omni Transformer à flux unique prédit ensemble les latents vidéo et audio, puis des décodeurs reconstruisent l'image et le son stéréo.
Cette conception cible un défaut courant : une chaîne séparant identité, transfert de mouvement, lip-sync, effets et upscale peut perdre identité ou synchronisation à chaque relais. H3 cherche à apprendre intention, identité visuelle, mouvement, rythme de montage, voix et ambiance dans un seul contexte.
Le système conserve trois couches :
- H3-Context-IR interprète les matériaux multimodaux libres et produit une représentation intermédiaire structurée.
- H3-Base génère l'audio-vidéo 768P à partir de cette représentation.
- H3-Regenerate-2K reprend le résultat de base et le contexte d'origine pour augmenter le détail.
Cette architecture explique à la fois la qualité et la réserve d'ouverture : la base publiée est substantielle, mais une partie du raisonnement et de la finition haute résolution reste livrée comme service.
H3 face à Seedance 2.5 : deux paris opposés
| Dimension | MiniMax H3 | Seedance 2.5 | Conséquence en production |
|---|---|---|---|
| Durée narrative native maximale | 15 secondes | 30 secondes, plus extensions | Seedance porte un arc plus long avant assemblage |
| Tableau de références | 12 fichiers : 9 images, 3 vidéos, 3 audios au plus | Jusqu'à 30 images, 10 vidéos et 10 audios | Seedance convient aux campagnes avec davantage de personnages, produits, voix et mouvements |
| Positionnement de sortie | Base 768P et parcours 2K ; stéréo native | Génération audio-vidéo hébergée ; API citées en 480p/720p | H3 privilégie résolution et portabilité ; Seedance, durée et volume de contrôle |
| Montage | Références multimodales et édition en langage naturel | Modifications par timestamp, fond vert, caméra et références | Seedance documente davantage de contrôles métier ; H3 fournit une base plus modifiable |
| Poids | H3-Base téléchargeable | Fermés | H3 peut être auto-hébergé, affiné, quantifié ou post-entraîné selon la licence |
| Licence | MiniMax H3 Community License | Conditions de service hébergé | H3 réduit le verrouillage technique sans supprimer l'examen juridique |
| Prix hébergé mis en avant | $0.08/s en 768P ; $0.13/s en 2K chez MiniMax | environ $0.473/s en 720p chez fal ; $0.36/s chez Modelflare | Fort avantage tarifaire H3, mais routes et résolutions non identiques |
Seedance 2.5 cherche à remplacer davantage d'une timeline professionnelle dans un appel hébergé. H3 rend un cœur de 15 secondes bon marché, téléchargeable et extensible. Un studio peut employer Seedance pour un plan maître long et riche en références, H3 pour des variantes courtes, des retouches contrôlées ou un affinage privé.
Ce que disent vraiment les préférences humaines aveugles
Arena classe des comparaisons anonymes par paires. C'est plus large qu'une démo fournisseur, mais cela reste un signal de préférence mobile, pas un benchmark de production contrôlé.
| Instantané Arena | MiniMax H3 | Seedance 2.5 720p | Gemini Omni 1.1 Flash | Interprétation prudente |
|---|---|---|---|---|
| Texte-vers-vidéo, 25 août | 1460±10, plage 4–7 | 1476±14, 3–7 | 1515±16, 1–3 | H3 et Seedance se chevauchent ; Gemini mène |
| Image-vers-vidéo, 25 août | 1494±6, 1–3 | 1483±12, 1–4 | 1488±11, 1–4 | Les trois occupent le même groupe statistique supérieur |
| Montage vidéo, 26 août | 1392±19, 1–5 | 1410±26, 1–3 | 1367±15, 3–5 | Seedance est numériquement supérieur, mais les intervalles se recouvrent largement |
Ces nombres autorisent « niveau frontière », pas « H3 bat Seedance 2.5 ». Les tableaux ne connaissent ni vos prompts, droits de référence, contraintes de marque, budget d'échec ni critères de réception. Seedance a aussi moins de votes que des modèles plus anciens dans ces instantanés.
La conclusion utile dépend de la tâche : H3 est très crédible pour la génération conditionnée par image et le montage ; Seedance garde son avantage contractuel pour les productions longues et riches en références. Gemini Omni montre qu'un modèle fermé abordable peut mener en texte-vers-vidéo.
H3 face aux modèles téléchargeables
Arena place H3 à côté de modèles téléchargeables, même si leurs licences diffèrent. L'écart de qualité dans les mêmes instantanés est inhabituel.
| Modèle téléchargeable | Licence affichée par Arena | Texte-vers-vidéo | Image-vers-vidéo |
|---|---|---|---|
| MiniMax H3 | MiniMax H3 Community License | 1460±10 | 1494±6 |
| Hunyuan Video 1.5 | Tencent community license | 1169±16 | 1197±16 |
| Kandinsky 5.0 T2V Pro | MIT | 1172±20 | — |
| Wan 2.2 A14B | Apache 2.0 | 1132±15 | 1170±10 |
| LTX-2 19B | LTX community license | 1152±8 | 1155±5 |
Un Elo ne décide pas chaque plan. L'enjeu est que le vidéo téléchargeable imposait souvent un compromis visible, alors que H3 rejoint le groupe de préférence des meilleurs systèmes fermés. Cela change l'achat, la recherche et les stratégies de repli avant même l'auto-hébergement.
Prix : le titre est juste, le dénominateur compte
| Route vérifiée le 30 août | Résolution | Prix par seconde générée | Sortie de 15 secondes | Exclusions importantes |
|---|---|---|---|---|
| API officielle MiniMax H3 | 768P | $0.08 | $1.20 | Vidéo de référence et images supplémentaires peuvent ajouter un coût |
| API officielle MiniMax H3 | 2K | $0.13 | $1.95 | Context-IR facturé séparément en tokens |
| Modelflare Seedance 2.5 | 480p | $0.18 | $2.70 | Requiert seedance-stable ; maximum 30 secondes |
| Modelflare Seedance 2.5 | 720p | $0.36 | $5.40 | Route et résolution différentes du 2K H3 |
| fal Seedance 2.5, estimation 16:9 | 720p | environ $0.473 | environ $7.10 | Formule liée à la surface d'image ; la vidéo de référence change la facturation |
| Google Gemini Omni Flash | 720p | environ $0.10 | $1.50 | Fermé ; tokens d'entrée et haute résolution séparés |
Avec H3, les références audio et les cinq premières images sont gratuites ; chaque image suivante coûte $0.04. La vidéo d'entrée est facturée selon sa durée au tarif de la résolution choisie. Régénérer du 768P en 2K coûte $0.05 par seconde de sortie. Un travail riche en références peut donc dépasser nettement le prix d'appel.
Chez Modelflare, Seedance 2.5 revient effectivement à $0.18/s en 480p et $0.36/s en 720p après le multiplicateur seedance-stable. C'est moins que la route fal citée, mais plus que H3 officiel. C'est une comparaison budgétaire, pas une preuve d'utilité identique.
La bonne métrique est le coût par seconde acceptée : générations réussies et ratées, références payantes, relances, montage humain et durée utilisable, divisés par les secondes retenues. Un modèle quatre fois plus cher peut gagner s'il évite assez de reprises.
Pourquoi l'auto-hébergement n'est pas gratuit
Le paquet ouvert change le contrôle, pas la physique.
- Le cœur est un générateur dense 33B avec encodeur Qwen3-VL-32B complet et plusieurs VAE. Les exemples SGLang officiels emploient quatre GPU par variante servie.
- La première version utilise full attention ; l'implémentation sparse attention viendra plus tard.
- Servir deux familles ajoute stockage, capacité chaude, chargement, observabilité, modération et mises à jour.
- H3-Base local produit du 768P. Le résultat 2K officiel requiert encore des services hébergés ou un pipeline communautaire validé à part.
- Le taux d'utilisation GPU décide l'économie. Une charge en rafales peut rendre la capacité locale inactive plus chère que l'API.
L'auto-hébergement se justifie si les sources doivent rester confinées, si un style récurrent mérite un LoRA, si la charge remplit les GPU ou si l'inférence doit être modifiée. L'API reste rationnelle pour les essais, les pointes et la finition 2K officielle.
Où H3 est réellement disruptif
- L'ouverture devient une décision de qualité, pas seulement d'idéologie. Évaluer un modèle téléchargeable n'impose plus automatiquement une sortie de seconde catégorie.
- Le prix de pointe subit une pression. Un 2K officiel à $0.13/s force les systèmes fermés à justifier leur prime par durée, contrôle, fiabilité ou intégration.
- Les tiers peuvent modifier la couche modèle. Quantification, LoRA, post-entraînement, nouveaux schedulers et inférence spécialisée ne dépendent plus d'une seule feuille de route.
- L'architecture hybride devient pratique. La base sensible ou répétitive reste locale ; Context-IR, régénération et capacité de pointe s'achètent au besoin.
- Le cycle des dérivés raccourcit. fal a lancé H3 Max, dérivé post-entraîné et optimisé, le même mois. fal annonce cinq secondes 768P en moins de trois secondes ; Artificial Analysis le place dans le groupe de tête texte-vers-vidéo. La vitesse est déclarative, mais l'existence du dérivé est vérifiable.
Ce dernier point est le plus profond : seule une base modifiable permet à une autre équipe d'attaquer simultanément qualité, latence et coût aux niveaux modèle et système.
Où la rupture s'arrête
- La licence communautaire n'est pas approuvée par l'OSI et exclut UE, Royaume-Uni, Corée du Sud et États-Unis sans licence distincte.
- Les produits commerciaux au-dessus de $20 millions de revenus annuels exigent une autorisation écrite ; les interfaces doivent afficher « MiniMax H3 ».
- Le contenu public généré comporte des obligations de divulgation, et les services dérivés doivent appliquer protections et restrictions.
- H3-Context-IR et la régénération 2K officielle ne font pas partie de la publication ouverte.
- Les informations de données et le code d'entraînement complets nécessaires à la reproduction ne sont pas publiés.
- Les poids ouverts ne règlent ni consentement, ressemblance, voix, droit d'auteur, sécurité de marque ni contrôle des sorties.
H3 bouleverse davantage la pile technique et économique qu'il ne supprime la dépendance au fournisseur. MiniMax ouvre la base précieuse tout en gardant modules hébergés, API commerciale et contrôle de licence.
Quel modèle pour quelle contrainte
| Contrainte principale | Meilleur point de départ | Pourquoi |
|---|---|---|
| Récit continu de 16–30 secondes | Seedance 2.5 | Deux fois la durée H3 et extensions documentées |
| Plus de 12 références mixtes | Seedance 2.5 | Jusqu'à 50 fichiers contre 12 pour H3 |
| Auto-hébergement, fine-tuning ou inférence personnalisée | H3 | Base téléchargeable et plusieurs runtimes |
| Vidéo courte 2K à bas coût | H3 | $0.13/s officiel et préférence solide |
| Signal image-vers-vidéo | H3, puis vérifier | Premier dans l'instantané, mais intervalles de tête superposés |
| Timestamp et fond vert | Seedance 2.5 | Contrat de montage professionnel plus explicite |
| Montage conversationnel par API fermée | Gemini Omni 1.1 Flash | Édition native, tête T2V et environ $0.10/s en 720p |
| Contrôle commercial par plan et élément | Famille Kling 3 | Storyboard, éléments et mouvement plus explicites |
| Écosystème Google ou OpenAI existant | Gemini/Veo ou Sora | Identité, sécurité, facturation et outils peuvent primer sur la portabilité |
« Meilleur point de départ » n'est pas un gagnant définitif. Testez le livrable exact dans un protocole contrôlé avant de changer le routage de production.
Un meilleur protocole d'évaluation
- Choisir 12–20 briefs autorisés couvrant dialogue, texte produit, mouvement humain, continuité, caméra, conditionnement par image, vidéo de référence et retouches précises.
- Fixer durée, ratio, classe de résolution, prompt, références et audio dans la limite de chaque contrat.
- Consigner les paramètres non pris en charge au lieu de donner silencieusement une tâche plus facile à un modèle.
- Garder tous les essais payés, refus de modération, timeouts et sorties inutilisables ; ne pas noter seulement la meilleure seed.
- Masquer les noms et évaluer identité, consignes, mouvement/physique, texte, synchronisation, continuité, localité des retouches et utilité finale.
- Mesurer attente, génération, relances, minutes de correction, coûts d'entrée/sortie, stockage et transfert.
- Rapporter taux utile au premier essai et coût par seconde acceptée avec intervalles ; ne pas tout réduire à une note opaque.
- Rejouer un petit ensemble sentinelle après tout changement de modèle, fournisseur, expanseur de prompt, sécurité ou prix.
Pour l'auto-hébergement, employer les mêmes hypothèses d'énergie, GPU réservés, utilisation, travail de déploiement et reprise. Comparer une facture API complète à la seule électricité locale n'est pas un TCO valide.
Limite de disponibilité Modelflare
Lors du contrôle du catalogue de production le 30 août, Modelflare n'exposait pas d'ID exact MiniMax-H3 ou hailuo-03. Cet article ne prétend pas que H3 est aujourd'hui appelable avec une clé API Modelflare.
Modelflare propose seedance-2.5 via l'API vidéo asynchrone compatible OpenAI dans seedance-stable, à $0.18/s en 480p et $0.36/s en 720p. Consultez le guide API Seedance 2.5 et la page de prix Seedance 2.5 avant génération.
Si H3 est ajouté, il faudra documenter ID exact, endpoint, champs de référence, résolutions, groupes, prix effectif et tâche réellement facturée. Une configuration amont ou un alias tiers ne suffit pas.
Questions fréquentes
MiniMax H3 est-il réellement open source ?
MiniMax l'affirme et livre de vrais poids, composants, recettes et droits de modification et redistribution. Selon la définition stricte de l'OSI, les restrictions territoriales/d'usage et l'absence du paquet complet font de « poids ouverts sous MiniMax H3 Community License » la formule la plus sûre.
H3 bat-il Seedance 2.5 ?
Pas universellement. H3 est numériquement devant en image-vers-vidéo ; Seedance 2.5 en texte-vers-vidéo et montage. Intervalles et plages se chevauchent, tandis que Seedance a un contrat plus fort de 30 secondes et 50 références.
H3 peut-il générer du 2K entièrement hors ligne ?
H3-Base ouvert produit du 768P. La recette 2K officielle combine inférence locale et API H3-Context-IR/H3-Regenerate-2K hébergées. Une alternative communautaire locale doit être évaluée séparément et ne peut être dite officielle sans preuve.
H3 local coûte-t-il moins que l'API ?
Cela dépend de l'utilisation, du matériel, de l'optimisation, des deux familles, de l'exploitation et de la qualité visée. L'API est souvent plus simple à faible volume ou en rafales ; charge continue, confidentialité ou fine-tuning peuvent justifier l'auto-hébergement.
Conclusion
MiniMax H3 réunit trois éléments rarement simultanés : préférences humaines de niveau frontière, prix officiel dès $0.08 par seconde générée et poids téléchargeables modifiables par des tiers. Une option à poids ouverts entre ainsi dans la sélection principale, et non dans un simple repli idéologique ou privé.
Les limites comptent autant. H3 est un système hybride open-core à licence communautaire restrictive, exigeant en matériel, avec des composants hébergés dans le parcours 2K officiel. Seedance 2.5 garde le contrat hébergé le plus ambitieux pour 30 secondes et 50 références ; Gemini Omni reste un concurrent fermé, fort et abordable.
Choisissez selon le goulot : H3 pour portabilité, modification, économie du format court ou qualité conditionnée par image ; Seedance pour continuité longue et vaste surface de références. Jugez les deux sur les sorties acceptées, pas sur les bandes de lancement.
Sources officielles et journal de mise à jour
Sources primaires et de mesure :
- MiniMax : lancement de H3
- MiniMax : poids ouverts et architecture de H3
- Dépôt officiel MiniMax H3
- MiniMax H3 Community License
- API MiniMax : contrat de génération vidéo
- Tarifs de l'API MiniMax
- ByteDance Seed : lancement de Seedance 2.5
- Google : contrat du modèle Gemini Omni Flash
- Google : tarifs de l'API Gemini
- Arena texte-vers-vidéo
- Arena image-vers-vidéo
- Arena montage vidéo
- Open Source Initiative : Open Source AI Definition 1.0
- fal : annonce du dérivé H3 Max
Journal :
- 30 août 2026 : publication initiale. Architecture, paquet ouvert, licence et tarifs H3, contrat Seedance 2.5, prix et disponibilité Modelflare et instantanés Arena datés ont été revérifiés. La couverture est une illustration éditoriale synthétique, pas une sortie H3, un benchmark ni une interface réelle.