Análisis de MiniMax H3: pesos abiertos, precio, calidad y disrupción

Informe verificado de MiniMax H3 sobre arquitectura y licencia de pesos abiertos, precios API, preferencias ciegas, autoalojamiento y comparación con Seedance 2.5 y otros modelos de vídeo.

MiniMax H3 es uno de los pocos lanzamientos de vídeo de 2026 que cambia a la vez la frontera de calidad y quién puede modificar la tecnología. Acepta texto, imágenes, vídeo y audio en un mismo contexto, genera vídeo de 4 a 15 segundos con audio estéreo nativo, ofrece flujos de 768P y 2K, y publica checkpoints descargables de H3-Base.

La conclusión rigurosa es más precisa que «H3 es de código abierto y supera a los modelos cerrados». H3 es un modelo de pesos abiertos, calidad de frontera y precio API muy agresivo; no es, sin embargo, un sistema de IA de código abierto completo según la definición de la OSI, ni los datos actuales de preferencia ciega prueban una victoria universal sobre Seedance 2.5. Seedance 2.5 conserva un contrato más amplio para historias de 30 segundos en una sola generación y paneles de referencias muy grandes. La ruptura de H3 consiste en reunir calidad punta, derecho de modificación y bajo precio alojado.

Las especificaciones, la licencia, los precios API y la disponibilidad en Modelflare se volvieron a comprobar el 30 de agosto de 2026. Las capturas de Arena corresponden al 25 y 26 de agosto de 2026 y cambiarán conforme aumenten los votos.

Veredicto ejecutivo

  • Apertura: H3 publica dos checkpoints base BF16 especializados, componentes del modelo y recetas para SGLang, vLLM, diffusers y ComfyUI. Es una entrega ejecutable, no una promesa limitada a un artículo.
  • Precio: MiniMax publica $0.08 por segundo generado a 768P y $0.13 a 2K. Los pesos abiertos no vuelven gratis la inferencia: trasladan la factura de la API a GPU, operaciones, almacenamiento e ingeniería.
  • Resultado: Arena sitúa a H3 y Seedance 2.5 en grupos superiores solapados. H3 encabeza la captura de imagen a vídeo; Seedance 2.5 queda algo por delante en texto a vídeo y edición, pero los intervalos de confianza se solapan en los tres casos.
  • Disrupción: H3 reduce de forma drástica la brecha histórica entre modelos descargables y vídeo cerrado de frontera. La aparición del derivado H3 Max en cuestión de semanas muestra que terceros pueden cambiar el modelo, no solo envolver su API.
  • Reserva principal: el recorrido oficial de calidad 2K todavía usa H3-Context-IR y H3-Regenerate-2K alojados, y la licencia comunitaria impone condiciones territoriales, de uso, divulgación, atribución y gran explotación comercial.

Qué entrega realmente MiniMax H3

Elemento Contrato H3 verificado
ID oficial del modelo API MiniMax-H3
Duración de salida 4–15 segundos, valores enteros
Salida Vídeo a 24 FPS con audio estéreo de 32 kHz
Resolución Salida base 768P; 2K mediante el flujo oficial de generación o regeneración
Modo primer/último fotograma Cero, una o dos imágenes
Modo de referencia Hasta 9 imágenes, 3 vídeos y 3 audios; 12 archivos como máximo total
Duración de referencias Cada vídeo o audio dura 2–15 segundos; cada modalidad suma como máximo 15 segundos
Diálogo La documentación enumera soporte estable para 11 idiomas
Checkpoints abiertos FL2VA para texto y primer/último fotograma; Ref2VA para referencias multimodales
Generador central H3-Omni-Transformer denso de 33B, codificador Qwen3-VL-32B y VAE visual y de audio
Runtimes recomendados SGLang, vLLM, diffusers y ComfyUI

La API muestra un único nombre, pero el paquete abierto contiene dos checkpoints base especializados. Es una diferencia operativa: servir a la vez generación de primer/último fotograma y referencias multimodales arbitrarias exige almacenamiento y capacidad para ambos recorridos.

Auditoría de apertura: cuatro capas, no una etiqueta

Capa Qué está abierto Qué sigue limitado Lectura práctica
Pesos y componentes de inferencia Familias completas de H3-Base, procesador, tokenizer, codificador, Omni Transformer, VisualVAE y AudioVAE El repositorio es grande y la inferencia de producción requiere mucha capacidad GPU Es posible ejecutar y ajustar localmente de verdad
Ecosistema de runtimes Recetas oficiales para cuatro runtimes, ejemplos descargables y casos 768P reproducibles La primera versión usa full attention; la atención dispersa llegará después La superficie de ingeniería ya sirve, pero aún no es la forma más eficiente
Canal de producto completo H3-Base local genera audio-vídeo 768P H3-Context-IR está alojado y el flujo oficial 2K llama a las API de Context-IR y regeneración El mejor flujo oficial es híbrido, no enteramente local
Licencia y reproducibilidad Permite modificación, derivados, redistribución y muchos usos comerciales dentro del territorio aplicable Licencia propia, territorios excluidos, restricciones de uso, deberes de divulgación, autorización desde $20M de ingresos y sin paquete completo de datos/código de entrenamiento «Pesos abiertos con licencia comunitaria» es más exacto que «totalmente abierto» sin condiciones

MiniMax denomina open source al lanzamiento. La Open Source AI Definition exige libertad para usar, estudiar, modificar y compartir con cualquier finalidad, además de la forma preferida para modificar el sistema, incluida información suficiente sobre datos y código de entrenamiento. Las restricciones territoriales y de uso de H3 y su paquete de entrenamiento incompleto no alcanzan ese umbral.

Eso no resta valor técnico al lanzamiento. Publicar una base de vídeo de frontera con derechos de modificación y redistribución es una contribución importante. La descripción precisa evita que un equipo confunda pesos descargables con derechos universales de despliegue.

Cómo está construido H3 y por qué importa

H3 empaqueta las modalidades en una secuencia única. El texto pasa por el codificador H3; las entradas visuales pasan por el codificador y VisualVAE; el audio, por AudioVAE. Un Omni Transformer de flujo único predice conjuntamente los latentes de vídeo y audio, que los decodificadores reconstruyen como imagen y sonido estéreo.

El diseño ataca un fallo recurrente: una cadena separada de referencia de sujeto, transferencia de movimiento, sincronización labial, efectos y escalado puede perder identidad o tiempo en cada traspaso. H3 intenta aprender intención, identidad visual, movimiento, ritmo de edición, voz y paisaje sonoro dentro del mismo contexto.

El sistema conserva tres capas:

  1. H3-Context-IR interpreta material multimodal libre y complejo y produce una representación intermedia estructurada.
  2. H3-Base genera audio-vídeo 768P a partir de esa representación.
  3. H3-Regenerate-2K vuelve a procesar el resultado base y el contexto original para añadir detalle.

Esta arquitectura explica tanto la calidad como la reserva de apertura. La base liberada es sustancial, pero parte del razonamiento y del acabado de alta resolución del sistema oficial se entrega como servicio.

H3 frente a Seedance 2.5: apuestas opuestas

Dimensión de decisión MiniMax H3 Seedance 2.5 Consecuencia en producción
Duración narrativa nativa máxima 15 segundos 30 segundos, más extensiones Seedance mantiene un arco más largo antes de unir clips
Panel de referencias 12 archivos: hasta 9 imágenes, 3 vídeos y 3 audios Hasta 30 imágenes, 10 vídeos y 10 audios Seedance encaja en campañas complejas con más personajes, productos, voces y movimientos
Posicionamiento de salida Base 768P y flujo 2K; estéreo nativo Generación audio-vídeo alojada; las API citadas ofrecen 480p/720p H3 prioriza resolución y portabilidad; Seedance, duración y volumen de control
Edición Referencias multimodales y edición de vídeo en lenguaje natural Edición por timestamp, fondo verde, perspectiva de cámara y referencias Seedance documenta más controles de producción; H3 brinda una base más modificable
Pesos Checkpoints H3-Base descargables Cerrados H3 puede autoalojarse, ajustarse, cuantizarse o posentrenarse donde lo permita la licencia
Licencia MiniMax H3 Community License Condiciones de servicio alojado H3 reduce el bloqueo técnico, no la revisión jurídica
Precio alojado destacado $0.08/s a 768P y $0.13/s a 2K en MiniMax Unos $0.473/s a 720p en fal; $0.36/s a 720p en Modelflare H3 tiene gran ventaja de tarifa, aunque rutas y resoluciones no sean idénticas

La división estratégica es clara. Seedance 2.5 busca sustituir más trabajo de una línea de tiempo profesional en una sola llamada alojada. H3 convierte un núcleo de frontera de 15 segundos en algo barato, descargable y extensible. Un estudio puede combinar ambos: Seedance para el plano maestro largo y cargado de referencias; H3 para variaciones cortas, ediciones controladas o ajuste privado.

Qué dicen realmente las preferencias humanas ciegas

Arena clasifica modelos mediante comparaciones anónimas por pares. Es más amplio que una demo elegida por el proveedor, pero sigue siendo una señal móvil de preferencia, no una prueba controlada de producción.

Captura de Arena MiniMax H3 Seedance 2.5 720p Gemini Omni 1.1 Flash Interpretación prudente
Texto a vídeo, 25 ago. 1460±10, rango 4–7 1476±14, rango 3–7 1515±16, rango 1–3 H3 y Seedance se solapan; Gemini lidera esta captura
Imagen a vídeo, 25 ago. 1494±6, rango 1–3 1483±12, rango 1–4 1488±11, rango 1–4 Los tres ocupan el mismo grupo estadístico superior
Edición de vídeo, 26 ago. 1392±19, rango 1–5 1410±26, rango 1–3 1367±15, rango 3–5 Seedance tiene cifra mayor, pero los intervalos se solapan mucho

Los números permiten llamar a H3 modelo de frontera. No permiten afirmar que «H3 vence a Seedance 2.5». Los tableros no incorporan tus prompts exactos, derechos sobre referencias, restricciones de marca, presupuesto de fallos ni criterios de aceptación. Seedance también tiene muchos menos votos que modelos antiguos en estas capturas, por lo que su estimación puede moverse.

La conclusión útil depende de la tarea: H3 es especialmente creíble en generación condicionada por imagen y edición; Seedance conserva ventaja contractual en producciones largas y cargadas de referencias. Gemini Omni recuerda que un modelo cerrado barato aún puede liderar la preferencia texto a vídeo.

H3 frente al campo descargable

Arena agrupa a H3 con modelos descargables, aunque sus licencias no son equivalentes. La diferencia de calidad dentro de las mismas capturas es inusual.

Modelo descargable Etiqueta de licencia en Arena Texto a vídeo Imagen a vídeo
MiniMax H3 MiniMax H3 Community License 1460±10 1494±6
Hunyuan Video 1.5 Tencent community license 1169±16 1197±16
Kandinsky 5.0 T2V Pro MIT 1172±20
Wan 2.2 A14B Apache 2.0 1132±15 1170±10
LTX-2 19B LTX community license 1152±8 1155±5

Un valor Elo no decide todos los planos. Lo importante es que el vídeo descargable solía exigir una pérdida visible de calidad, mientras H3 aparece en el mismo grupo de preferencia que los mejores sistemas cerrados. Eso cambia compras, investigación y estrategia de respaldo antes incluso de autoalojarlo.

Precio: el titular es real, pero hace falta denominador

Ruta comprobada el 30 de agosto Resolución Precio por segundo generado Salida de 15 segundos Exclusiones importantes
API oficial MiniMax H3 768P $0.08 $1.20 El vídeo de referencia y las imágenes adicionales pueden sumar coste
API oficial MiniMax H3 2K $0.13 $1.95 Context-IR se factura aparte por tokens
Modelflare Seedance 2.5 480p $0.18 $2.70 Requiere seedance-stable; máximo 30 segundos
Modelflare Seedance 2.5 720p $0.36 $5.40 Ruta de proveedor y resolución distintas del 2K de H3
fal Seedance 2.5, estimación 16:9 720p unos $0.473 unos $7.10 La fórmula depende del área del fotograma; el vídeo de referencia cambia la factura
Google Gemini Omni Flash 720p unos $0.10 $1.50 Modelo cerrado; tokens de entrada y resoluciones mayores se tratan aparte

En H3, las referencias de audio son gratuitas, las primeras cinco imágenes son gratuitas y cada imagen adicional cuesta $0.04. El vídeo de entrada se cobra por duración a la tarifa de la resolución elegida. Regenerar un resultado 768P a 2K cuesta $0.05 por segundo de salida. Un trabajo con muchas referencias puede superar ampliamente el precio anunciado.

En Seedance 2.5, los precios efectivos en vivo de Modelflare son $0.18/s a 480p y $0.36/s a 720p tras el multiplicador de seedance-stable. Es menos que la ruta citada de fal, pero más que la API oficial de H3. Sirve para presupuesto, no prueba igual calidad útil entre clips configurados de forma distinta.

La métrica correcta es el coste por segundo aceptado: generaciones buenas y fallidas, referencias pagadas, reintentos, edición humana y duración final utilizable, dividido por segundos aceptados. Un modelo cuatro veces más caro por segundo generado puede ganar si evita suficientes reintentos o posproducción.

Por qué autoalojado no significa gratis

El paquete abierto de H3 cambia el control, no la física.

  1. El núcleo es un generador denso de 33B con el codificador Qwen3-VL-32B completo y varios VAE. Los ejemplos oficiales de SGLang usan cuatro GPU por variante servida.
  2. La versión inicial ejecuta full attention. La implementación de atención dispersa empleada en desarrollo se publicará después.
  3. Servir las dos familias añade almacenamiento, capacidad caliente, carga de modelos, observabilidad, moderación y actualizaciones.
  4. H3-Base local produce 768P. Reproducir el 2K oficial aún exige servicios alojados o un flujo comunitario validado aparte.
  5. La utilización de GPU decide la economía. Un equipo con tráfico a ráfagas puede pagar más por capacidad local ociosa que por la API.

El autoalojamiento resulta atractivo si los recursos deben permanecer en un entorno controlado, un estilo repetible justifica LoRA, el tráfico usa bien las GPU o el equipo necesita modificar la inferencia. La API sigue siendo razonable para pruebas, picos y el acabado oficial 2K.

Dónde H3 es realmente disruptivo

  1. Convierte la apertura en una decisión de calidad, no solo ideológica. Ya no hay que aceptar automáticamente una clase de salida inferior al evaluar un modelo descargable.
  2. Presiona el precio de frontera. El 2K oficial a $0.13/s obliga a los sistemas cerrados a justificar su prima con duración, controles, fiabilidad o integración.
  3. Permite cambiar la capa de modelo. Cuantización, LoRA, posentrenamiento, nuevos schedulers e inferencia especializada no dependen de una sola hoja de ruta.
  4. Hace viable la arquitectura híbrida. La base sensible o repetitiva puede quedar local, comprando Context-IR, regeneración o capacidad de pico según necesidad.
  5. Acorta el ciclo de derivados. fal presentó H3 Max, derivado posentrenado y optimizado, dentro del mismo mes. fal informa de 5 segundos a 768P en menos de 3 segundos; Artificial Analysis lo sitúa en el grupo superior actual de texto a vídeo. La velocidad procede del proveedor, pero la existencia del derivado puede verificarse de forma independiente.

Ese último punto es la ruptura más profunda. Una API cerrada puede bajar precios o sumar parámetros; solo una base modificable permite que otro equipo ataque simultáneamente calidad, latencia y coste en las capas de modelo y sistema.

Dónde termina la disrupción

  • La licencia comunitaria no está aprobada por la OSI y excluye UE, Reino Unido, Corea del Sur y Estados Unidos salvo licencia separada.
  • Los productos comerciales de empresas con más de $20 millones de ingresos anuales requieren autorización escrita; la interfaz comercial debe mostrar «MiniMax H3» de forma visible.
  • El contenido público generado tiene deberes de divulgación y los servicios derivados deben aplicar salvaguardas y restricciones de uso.
  • H3-Context-IR y la implementación oficial de regeneración 2K no forman parte de la entrega abierta.
  • No se publican la información de datos ni el código de entrenamiento completos para reproducir el sistema.
  • Los pesos abiertos no resuelven consentimiento, imagen, voz, copyright, seguridad de marca ni revisión de resultados.

H3 altera más la pila técnica y económica de lo que elimina la dependencia del proveedor. MiniMax abre la valiosa base, pero conserva módulos de calidad alojados, API comercial y control de licencia.

Qué modelo encaja con cada restricción

Restricción principal Mejor punto de partida Motivo
Narrativa continua de 16–30 segundos Seedance 2.5 Duplica la duración de H3 y documenta extensiones
Más de 12 referencias mixtas Seedance 2.5 Hasta 50 archivos frente al límite de 12 de H3
Autoalojamiento, ajuste o inferencia propia H3 Checkpoints base descargables y varios runtimes
Vídeo corto 2K de bajo coste H3 Tarifa oficial de $0.13/s y preferencia sólida
Señal de preferencia imagen a vídeo H3, y después verificar Primero en la captura actual, aunque los intervalos superiores se solapan
Flujo por timestamp y fondo verde Seedance 2.5 Contrato de edición profesional más explícito
Edición conversacional por API cerrada Gemini Omni 1.1 Flash Edición conversacional nativa, liderazgo T2V actual y unos $0.10/s a 720p
Control comercial por plano y elemento Familia Kling 3 Superficie más explícita de storyboard, elementos y movimiento
Infraestructura Google u OpenAI existente Gemini/Veo o Sora Identidad, seguridad, facturación y herramientas pueden pesar más que la portabilidad

«Mejor punto de partida» no significa ganador final. Hay que probar el entregable real bajo control antes de cambiar el enrutamiento de producción.

Un protocolo de evaluación mejor

  1. Elegir 12–20 briefs autorizados que cubran diálogo, texto de producto, movimiento humano, continuidad de personajes, cámara, condicionamiento por imagen, vídeo de referencia y ediciones precisas.
  2. Fijar duración, relación de aspecto, clase de resolución, prompt, archivos de referencia y audio en la medida en que cada contrato lo permita.
  3. Registrar parámetros no soportados en vez de dar silenciosamente una tarea más fácil a un modelo.
  4. Conservar todos los intentos pagados, bloqueos de moderación, timeouts y descartes; no puntuar solo la mejor seed.
  5. Ocultar el nombre del modelo y evaluar identidad, seguimiento de instrucciones, movimiento/física, texto, sincronía, continuidad, localidad de edición y utilidad final.
  6. Medir cola, generación, reintentos, minutos de corrección, costes de entrada y salida, almacenamiento y tráfico.
  7. Informar de utilidad al primer intento y coste por segundo aceptado con intervalos; no condensarlo todo en una «calidad» opaca.
  8. Repetir un conjunto centinela menor cuando cambie el modelo, proveedor, expansor de prompt, seguridad o precio.

Para autoalojamiento, usar los mismos supuestos de energía, GPU reservada, utilización, trabajo de despliegue y recuperación. Comparar una factura API completa solo con la electricidad local no es un TCO válido.

Límite de disponibilidad en Modelflare

En la revisión del catálogo de producción del 30 de agosto, Modelflare no ofrecía un ID exacto MiniMax-H3 ni hailuo-03. Este artículo no sugiere que H3 pueda llamarse hoy con una clave API de Modelflare.

Modelflare sí ofrece seedance-2.5 mediante la API de vídeo asíncrona compatible con OpenAI en seedance-stable, con precios efectivos de $0.18/s para 480p y $0.36/s para 720p. Consulta la guía de la API Seedance 2.5 y la página de precios de Seedance 2.5 antes de generar.

Si H3 se incorpora más adelante, el artículo deberá añadir ID exacto, endpoint, campos de referencia expuestos, resoluciones, grupos, precio efectivo y una tarea facturada real. Una configuración upstream o un alias externo no bastan como prueba.

Preguntas frecuentes

¿MiniMax H3 es realmente de código abierto?

MiniMax lo describe así y entrega pesos, componentes, recetas, modificación y redistribución reales. Según la definición más estricta de la OSI, las restricciones territoriales/de uso y la ausencia del paquete completo de entrenamiento hacen más segura la descripción «pesos abiertos bajo MiniMax H3 Community License».

¿H3 supera a Seedance 2.5?

No de forma universal. H3 tiene mejor cifra en la captura actual de imagen a vídeo; Seedance 2.5, en texto a vídeo y edición. Sus intervalos y rangos se solapan, mientras Seedance dispone de un contrato superior de 30 segundos y 50 referencias.

¿Puede H3 generar 2K completamente sin conexión?

H3-Base abierto produce 768P. La receta 2K oficial combina inferencia base local con H3-Context-IR y H3-Regenerate-2K alojados. Una alternativa comunitaria local debe evaluarse aparte y no debe llamarse reproducción oficial sin pruebas.

¿H3 local es más barato que la API?

Depende de utilización, hardware, optimización, ambas familias de checkpoints, operaciones y objetivo de calidad. La API suele ser más simple con poco volumen o ráfagas; cargas sostenidas, privacidad o ajuste propio pueden justificar el autoalojamiento.

Conclusión

MiniMax H3 es disruptivo porque combina tres hechos que rara vez coinciden: preferencia humana de frontera, precio oficial desde $0.08 por segundo generado y pesos descargables modificables. Introduce un modelo de pesos abiertos en la lista principal, no como respaldo elegido solo por filosofía o privacidad.

Los límites importan igual. H3 es un sistema híbrido open-core con licencia comunitaria restrictiva, gran demanda de hardware y componentes alojados en el flujo oficial 2K. Seedance 2.5 conserva el contrato alojado más ambicioso para historias de 30 segundos y paneles de 50 referencias; Gemini Omni sigue siendo un rival cerrado y barato.

Elegir según el cuello de botella: H3 cuando importen portabilidad, modificación, economía de formato corto o calidad condicionada por imagen; Seedance cuando continuidad larga y muchas referencias justifiquen la prima. Ambos deben medirse por salida aceptada, no por vídeos de lanzamiento.

Fuentes oficiales y registro de actualización

Fuentes primarias y de medición:

Registro de actualización:

  • 30 de agosto de 2026: primera publicación. Se volvieron a comprobar arquitectura, paquete abierto, licencia y precios de H3, contrato de Seedance 2.5, precios y disponibilidad de Modelflare y capturas fechadas de Arena. La portada es una ilustración editorial sintética, no una salida de H3, un benchmark ni una interfaz real.