MiniMax H3 深度报告:开放权重、价格、效果与颠覆性

基于官方资料和匿名偏好数据,深度审视 MiniMax H3 的开放权重架构、社区许可、API 价格、自托管成本,以及与 Seedance 2.5 等前沿视频模型的差异。

MiniMax H3 是 2026 年少数同时改变“效果上限”和“谁能改模型”的视频模型。它能在同一上下文中理解文字、图片、视频与音频,生成 4–15 秒、带原生双声道音频的视频,提供 768P 与 2K 工作流,并公开可下载的 H3-Base checkpoint。

但真正严谨的结论不是“H3 已完全开源,而且打败了所有闭源模型”。H3 是达到前沿水平、API 定价激进的开放权重模型,但它不是完整的 OSI 意义上的开源 AI 系统;现有匿名人类偏好数据也不能证明它全面胜过 Seedance 2.5。 Seedance 2.5 在单次 30 秒叙事和超大参考素材板上仍拥有更强的公开合同。H3 的颠覆性在于,它第一次把顶级效果、可修改权与低价托管调用大规模放到同一款视频模型里。

下文的官方参数、许可、API 价格与 Modelflare 可用状态均在 2026 年 8 月 30 日重新核验。Arena 榜单快照分别标注为 8 月 25–26 日,后续会随投票变化。

核心结论

  • 开放性: H3 公开了两套面向不同任务的 BF16 基础 checkpoint、模型组件,以及 SGLang、vLLM、diffusers、ComfyUI 配方。这是真正能下载和运行的发布,不是只在论文中承诺。
  • 价格: MiniMax 官方列出的 768P 输出价为每生成秒 $0.08,2K 为 $0.13。开放权重不等于推理免费,只是把 API 账单转移成 GPU、运维、存储和工程成本。
  • 效果: Arena 将 H3 与 Seedance 2.5 放在重叠的头部区间。H3 在图生视频快照中暂列第一;Seedance 2.5 在文生视频与视频编辑中数值略高,但三项对比的置信区间都重叠。
  • 颠覆性: H3 显著缩小了可下载视频模型与闭源前沿模型之间长期存在的效果差距。同月出现更快的 H3 Max 衍生模型,是下游团队能够修改模型层、而不只是包装 API 的早期证据。
  • 关键限制: 官方 2K 高质量路径仍使用托管的 H3-Context-IR 与 H3-Regenerate-2K;社区许可还包含地区、用途、披露、署名和大型商业产品等条件。

MiniMax H3 到底公开了什么

项目 已核验的 H3 合同
官方 API 模型 ID MiniMax-H3
输出时长 4–15 秒,只接受整数
输出 24 FPS 视频与 32 kHz 双声道音频
分辨率 基础输出 768P;通过官方生成或 regeneration 工作流得到 2K
首尾帧模式 0、1 或 2 张图片
参考模式 最多 9 图、3 视频、3 音频;全部素材合计最多 12 个文件
参考素材时长 单个视频或音频 2–15 秒;每种模态合计不超过 15 秒
对话语言 官方列出 11 种稳定支持语言
开放 checkpoint FL2VA 负责文字与首尾帧任务;Ref2VA 负责多模态参考任务
核心生成器 33B 稠密 H3-Omni-Transformer,配合 Qwen3-VL-32B encoder 与视听 VAE
推荐运行时 SGLang、vLLM、diffusers、ComfyUI

API 对外只有一个模型名,但开放包内部是两套专业化基础 checkpoint。这个差异会直接影响运维:如果团队既要提供首尾帧生成,又要支持任意多模态参考,就要为两条路径准备存储和运行容量。

开放性审计:不要只看一个“开源”标签

层级 已开放部分 仍有限制的部分 实际判断
权重与推理组件 完整 H3-Base checkpoint 系列、processor、tokenizer、encoder、Omni Transformer、VisualVAE 与 AudioVAE 仓库体积很大,生产推理仍需要可观 GPU 容量 可以真实本地运行与微调
运行时生态 四套主要运行时的官方配方、可下载样例与可复现 768P 案例 初始版本仍使用 full attention;sparse-attention 推理以后再发布 工程面已经可用,但还不是最高效形态
完整产品链路 本地 H3-Base 能生成 768P 音视频 H3-Context-IR 是托管系统;官方完整 2K 路径会调用 Context-IR 与 regeneration API 最高质量官方链路是混合式,而非完全本地
许可与可复现性 适用地区内允许修改、衍生、再分发与大量商业使用 自定义许可、排除地区、用途限制、披露义务、$2000 万年营收授权门槛,并且没有完整训练数据/训练代码包 “社区许可下的开放权重”比无条件“完全开源”更准确

MiniMax 官方将这次发布称为 open source。但按照 Open Source AI Definition,开源 AI 需要允许任何人出于任何目的使用、研究、修改和分享,并提供修改系统所需的优选形式,包括足够的数据说明与训练代码。H3 的地区、用途限制以及不完整的训练包没有达到这条标准。

这并不是在做词语游戏或否定贡献。把前沿视频基础模型连同修改和分发权真正交给开发者,本身就是重大进展。使用准确称谓,是为了避免团队把“能下载权重”误解成“全球任何场景都自动获得部署权”。

H3 的架构为什么重要

H3 把多模态输入组织成同一条 packed sequence。文字进入 H3 encoder;视觉输入同时进入 encoder 与 VisualVAE;音频进入 AudioVAE。单流 Omni Transformer 联合预测视频与音频 latent,再由各自 decoder 还原最终画面和双声道声音。

它针对的是一个反复出现的生产故障:如果主体参考、动作迁移、口型、音效和超分分别交给多套模型,每次交接都可能丢失身份、时间关系或构图。H3 试图在同一上下文里共同学习文字意图、视觉身份、动作、剪辑节奏、声音与环境声。

完整系统仍然分成三层:

  1. H3-Context-IR 深度理解自由形式的复杂多模态素材,生成结构化中间表达。
  2. H3-Base 根据中间表达生成 768P 音视频。
  3. H3-Regenerate-2K 将基础结果与原始上下文再次送入生成流程,补出更高细节。

这套架构同时解释了效果主张与开放性限制。公开的基础模型很有价值,但官方系统中的推理编排和高分辨率收尾仍有一部分以服务形式提供。

H3 与 Seedance 2.5:两种相反的下注

决策维度 MiniMax H3 Seedance 2.5 对生产的影响
单次原生叙事时长 15 秒 30 秒,并支持延长 Seedance 在拼接前可以承载更长故事弧
参考素材板 合计 12 个文件:最多 9 图、3 视频、3 音频 最多 30 图、10 视频、10 音频 多角色、多商品、多声音与多动作参考的复杂活动更适合 Seedance
输出定位 768P 基础与 2K 工作流;原生双声道 托管音视频联合生成;本文引用的 API 暴露 480p/720p H3 强调分辨率与可移植性;Seedance 强调时长与控制容量
编辑 多模态参考与自然语言视频编辑 时间戳级编辑、绿幕、机位与参考编辑 Seedance 的专业制作控制写得更明确;H3 提供更可修改的基础
权重 可下载 H3-Base checkpoint 闭源 许可允许时,H3 可自托管、微调、量化或继续训练
许可 MiniMax H3 Community License 托管服务条款 H3 降低技术锁定,但没有消除法律审查
托管标价 MiniMax 上 768P $0.08/秒,2K $0.13/秒 fal 720p 约 $0.473/秒;Modelflare 720p $0.36/秒 H3 标价优势很大,但调用路径与分辨率并不完全相同

两边的战略分歧很清楚。Seedance 2.5 想用一次托管调用替代更多专业时间线工作;H3 则把 15 秒前沿核心做得更便宜、可下载、可扩展。一个工作室完全可能同时使用两者:长时且参考密集的主镜头走 Seedance,短商品变体、精确编辑或私有微调走 H3。

匿名人类偏好榜单真正说明了什么

Arena 根据匿名模型两两对战中的用户偏好排名。它比厂商精选 Demo 更广,但仍是持续变化的偏好信号,不是受控的生产基准。

Arena 快照 MiniMax H3 Seedance 2.5 720p Gemini Omni 1.1 Flash 严谨解读
文生视频,8 月 25 日 1460±10,排名区间 4–7 1476±14,区间 3–7 1515±16,区间 1–3 H3 与 Seedance 重叠;Gemini 在该快照领先
图生视频,8 月 25 日 1494±6,区间 1–3 1483±12,区间 1–4 1488±11,区间 1–4 三者处于同一头部统计区间
视频编辑,8 月 26 日 1392±19,区间 1–5 1410±26,区间 1–3 1367±15,区间 3–5 Seedance 数值更高,但区间大幅重叠

这些数字足以支持“H3 已进入前沿模型”这一判断,却不能支持“H3 打败 Seedance 2.5”。榜单无法代表你的准确 Prompt、素材授权、品牌限制、失败预算与交付验收。快照中 Seedance 的票数也明显少于老模型,估值仍可能移动。

对效果最有用的结论应当按任务拆分:H3 在图像条件生成与编辑方面非常有竞争力;Seedance 的规格优势仍然是长叙事与重参考制作;Gemini Omni 则证明低价闭源模型仍可能在文生视频偏好上领先。

H3 与其他可下载模型的差距

Arena 会把 H3 与其他可下载模型放在相同许可筛选中,但这些许可并不等价。同一批快照里的效果差距很大。

可下载模型 Arena 显示的许可 文生视频 图生视频
MiniMax H3 MiniMax H3 Community License 1460±10 1494±6
Hunyuan Video 1.5 Tencent community license 1169±16 1197±16
Kandinsky 5.0 T2V Pro MIT 1172±20
Wan 2.2 A14B Apache 2.0 1132±15 1170±10
LTX-2 19B LTX community license 1152±8 1155±5

这不是说一个 Elo 数字可以裁定所有镜头。真正重要的是,可下载视频模型过去通常意味着明显的效果妥协,而 H3 直接进入了最佳闭源系统的偏好区间。即使企业最终没有自托管,这也会改变采购、研究与 fallback 策略。

价格:低价是真的,但比较必须写清分母

8 月 30 日核验路径 分辨率 每生成秒价格 15 秒输出 未包含的重要成本
MiniMax 官方 H3 API 768P $0.08 $1.20 参考视频输入与额外图片可能加价
MiniMax 官方 H3 API 2K $0.13 $1.95 Context-IR 另按 Token 计费
Modelflare Seedance 2.5 480p $0.18 $2.70 需要 seedance-stable;最长 30 秒
Modelflare Seedance 2.5 720p $0.36 $5.40 与 H3 2K 的供应路径和分辨率不同
fal Seedance 2.5,16:9 估算 720p 约 $0.473 约 $7.10 Token 公式随画面面积变化;视频参考会改变计费
Google Gemini Omni Flash 720p 约 $0.10 $1.50 闭源;输入 Token 与更高分辨率另有规则

H3 的音频参考免费,前 5 张参考图片免费,之后每张 $0.04;参考视频按时长和目标分辨率费率计费。将 768P 结果 regeneration 到 2K 需要每输出秒 $0.05。因此,重参考任务的真实价格可能明显高于表面输出单价。

Seedance 2.5 在 Modelflare 的实时有效价格仍为 480p 每秒 $0.18、720p 每秒 $0.36,已包含 seedance-stable 分组倍率。它比 fal 引用路径便宜,但仍高于 H3 官方托管价格。这只能用于预算,不代表两条不同配置的视频具有相同可用效果。

生产中应该比较的是每个验收通过秒的成本:所有成功与失败生成、付费参考、重试、人工编辑时间和最终可用时长,除以真正被接受的输出秒数。单生成秒贵四倍的模型,如果能显著减少返工或替代昂贵后期,仍可能在最终成本上获胜。

为什么自托管不等于免费

H3 开放包改变的是控制权,不会改变计算规律。

  1. 核心是 33B 稠密生成器,还包括完整 Qwen3-VL-32B encoder 与多套 VAE。官方 SGLang 示例为每个 serving variant 使用 4 张 GPU。
  2. 初始开放版本运行 full attention;开发中使用的 sparse-attention 推理实现要在之后发布。
  3. 同时服务两套 checkpoint 会增加存储、预热容量、模型加载、可观测性、审核与升级工作。
  4. 本地 H3-Base 输出 768P。复现官方 2K 结果仍要使用托管服务,或另行验证社区方案。
  5. GPU 利用率决定经济性。流量突发的团队可能为闲置自托管容量支付更多,即使边际 GPU 秒看起来便宜。

当原始素材必须留在受控环境、固定风格值得投入 LoRA、流量足够稳定能吃满 GPU,或团队确实要修改推理层时,自托管很有吸引力。实验、突发流量和官方 2K 收尾继续使用 API 也完全合理。

H3 真正颠覆了什么

  1. 开放性从信仰题变成效果题。 团队现在可以评估可下载模型,而不必先接受二线输出质量。
  2. 前沿价格开始承压。 官方 2K 每秒 $0.13,迫使闭源系统用更长时长、更多控制、可靠性或工作流整合来证明溢价。
  3. 下游工程可以修改模型层。 量化、LoRA、继续训练、新 scheduler 和专用推理不再只能等待单一厂商路线图。
  4. 混合架构变得实际。 敏感或重复的基础生成可以留在本地,Context-IR、regeneration 或突发容量按需购买。
  5. 衍生周期被压缩。 fal 在同月推出后训练并优化推理的 H3 Max。fal 声称 5 秒 768P 可在 3 秒内生成;Artificial Analysis 也将其放入当前文生视频头部区间。速度是厂商数据,但衍生模型已经存在这一事实可独立观察。

最后一点最具颠覆性。闭源 API 也能降价或增加参数,但只有可修改基础模型允许另一支团队同时从模型与系统层攻击质量、延迟和成本。

颠覆性在哪里停止

  • 社区许可不是 OSI 批准许可,默认排除欧盟、英国、韩国与美国;这些地区需要另行取得许可。
  • 年营收超过 $2000 万的商业产品要先获得书面授权;商业界面必须显著展示“MiniMax H3”。
  • 公开生成内容有披露要求;下游服务还要部署安全措施并执行使用限制。
  • H3-Context-IR 与官方 2K regeneration 实现不在开放发布中。
  • 足以复现系统的训练数据说明与完整训练代码没有公开。
  • 开放权重不会自动解决肖像、声音、同意、版权、品牌安全与人工审片义务。

因此,H3 更大程度上颠覆了技术与经济栈,而不是彻底消除供应商依赖。MiniMax 开放了最有价值的基础层,同时保留托管质量模块、商业 API 与许可控制。

哪个模型更适合哪种生产约束

首要约束 更适合先试 原因
16–30 秒连续叙事 Seedance 2.5 单次时长是 H3 的两倍,并有明确延长能力
超过 12 个混合参考 Seedance 2.5 最多 50 个文件,对比 H3 上限 12 个
自托管、微调或定制推理 H3 可下载基础 checkpoint 与多运行时支持
低成本 2K 短视频 H3 官方 2K $0.13/秒,且偏好数据很强
图生视频偏好信号 H3,然后实测 当前 Arena 快照暂列第一,但头部置信区间重叠
时间戳与绿幕工作流 Seedance 2.5 专业编辑合同更明确
对话式闭源 API 编辑 Gemini Omni 1.1 Flash 原生对话编辑、当前文生视频领先,720p 约 $0.10/秒
多镜头与元素级商业控制 Kling 3 系列 更明确的分镜、元素与动作控制面
已有 Google 或 OpenAI 生产体系 Gemini/Veo 或 Sora 身份、安全、计费与工具整合可能比可移植性更重要

“更适合先试”不是最终排名。改变生产路由之前,必须用准确交付物做受控评测。

更有意义的实测方法

  1. 选择 12–20 个已获授权的 Brief,覆盖对话、商品文字、人体动作、多角色连续性、运镜、图像条件、视频参考与局部编辑。
  2. 在合同允许范围内,尽量固定输出时长、画幅、分辨率档位、Prompt、参考文件与音频要求。
  3. 对不支持的参数做记录,不要静默给其中一款模型更简单的任务。
  4. 保留每次付费尝试、审核失败、超时和废片,不得只评分最佳 seed。
  5. 隐藏模型名后,让审片者分别评估身份、指令遵循、运动/物理、文字、音画同步、时间连续性、编辑局部性与最终可用性。
  6. 记录排队时间、生成时间、重试次数、人工修改分钟数、输入费、输出费、存储与流量。
  7. 报告首轮可用率与每验收通过秒成本,并给出置信区间;不要把所有结果压成一个不透明“质量总分”。
  8. 任何模型、供应商、Prompt 扩写器、安全策略或价格发生变化后,都用较小的哨兵集复测。

自托管还要使用一致的电力、预留 GPU、利用率、部署人力与故障恢复假设。拿 API 全额账单只和本地集群电费比较,不是有效的 TCO 分析。

Modelflare 当前可用边界

截至 8 月 30 日生产目录核验,Modelflare 尚未暴露准确的 MiniMax-H3hailuo-03 模型 ID。本文不暗示 H3 当前可以通过 Modelflare API Key 调用。

Modelflare 已在 seedance-stable 中通过 OpenAI 兼容异步 Video API 提供 seedance-2.5,实时有效价格为 480p 每秒 $0.18、720p 每秒 $0.36。生成前请阅读本地化的 Seedance 2.5 API 指南,并核对实时 Seedance 2.5 价格页

如果未来接入 H3,本文必须补充准确模型 ID、Endpoint、实际暴露的参考字段、分辨率、分组、有效价格和一条真实计费任务。仅有上游配置或第三方别名不能证明可用。

常见问题

MiniMax H3 到底算不算真正开源?

MiniMax 将其称为开源,发布内容也确实包括真实权重、组件、推理配方,以及修改和再分发权。按更严格的 OSI Open Source AI 定义,自定义地区/用途限制与缺失的完整训练包,意味着“MiniMax H3 社区许可下的开放权重”是更稳妥的描述。

H3 是否比 Seedance 2.5 更强?

不能全面下结论。当前 Arena 图生视频快照中 H3 数值领先;文生视频与编辑中 Seedance 2.5 数值领先。两者的置信区间与排名区间都重叠,而 Seedance 还拥有更强的 30 秒和 50 参考素材合同。

H3 能不能完全离线生成 2K?

开放的 H3-Base 输出 768P。MiniMax 官方完整 2K 配方会把本地基础推理与托管 H3-Context-IR、H3-Regenerate-2K API 结合。完全本地的社区替代方案需要另行验证,没有证据时不能称为复现了官方路径。

本地运行 H3 一定比 API 便宜吗?

取决于利用率、硬件、运行时优化、两套 checkpoint、运维与质量目标。低量或突发任务通常 API 更简单;持续工作负载、隐私需求或定制微调才更可能证明自托管合理。

结论

MiniMax H3 的颠覆性来自三件通常不会同时发生的事:前沿级人类偏好结果、最低每生成秒 $0.08 的官方托管价,以及下游团队能够修改的可下载权重。它让开放权重模型进入主选清单,而不再只是为了理念或隐私才采用的 fallback。

它的限制同样重要。H3 是带严格社区许可的混合开放核心系统,硬件需求不低,官方 2K 高质量路径还有托管模块。Seedance 2.5 仍是 30 秒叙事与 50 个参考素材板上更激进的托管生产合同;Gemini Omni 也仍是很强的低价闭源竞争者。

按照瓶颈选择:看重可移植、可修改、短视频经济性或图像条件效果时优先测试 H3;看重长时连续性与巨大参考控制面时优先测试 Seedance。两者都要按验收通过产出判断,而不是看发布精选片。

官方资料与更新记录

一手资料与测量来源:

更新记录:

  • 2026 年 8 月 30 日: 首次发布。重新核验 H3 官方架构、开放包、许可、API 价格、Seedance 2.5 合同、Modelflare 实时价格与可用状态,以及带日期的 Arena 快照。封面是合成编辑插画,不是 H3 输出、基准结果或真实产品界面。