先说结论:这是重要的开放权重发布,但“开放 H3”不是一个布尔值

MiniMax H3 把文本、图像、视频和音频放进同一套上下文,让创作者用自然语言描述“参考哪段运镜、保留谁的身份、采用什么音色、在第几秒切镜”。官方规格支持 4—15 秒、多种画幅、24fps 与原生双声道,首尾帧 FL2VA 和多模态参考 Ref2VA 各有独立 checkpoint。对中文创作者来说,中文对白在官方列出的 11 种稳定语言中,也比只支持英语的开放视频模型更值得实测。

真正需要拆开的,是“本地”和“完整”。官方文档说明完整 H3 由三个模块组成:Context-IR 负责理解复杂参考并生成中间表示,H3-Base 生成 768p 音视频,Regenerate-2K 再利用原上下文重生成高分辨率结果。目前可下载的是 BF16 Base 权重;Context-IR 依赖多阶段托管模型和服务,没有包含在开放版本;2K 模块仍待发布。官方推荐的完整 2K workflow 因此会同时调用 API 与本地 Base。初始开放版还采用 full attention,训练时使用的 sparse attention 实现也被列为未来发布。

最值得拍的不是样片合集,而是同输入、同种子、同流程的对照

实测可以准备三组合法素材:一组中文口播,一组首尾帧运动,一组人物、动作、声音混合参考。每组分别记录本地原始提示、按官方指南整理的提示、调用 Context-IR 后的中间提示和最终视频,对比主体一致性、镜头时序、口型、声道、字幕文字与背景人物动作。所有样片保留种子、版本、分辨率、显存、生成时间和失败次数,避免只选最好的一次。社区已有同提示对比,但不同模型对提示结构的偏好不同,“同一句 prompt”也不必然等于公平比较。

权利与安全是创作流程的一部分。图片、视频、声音参考应能追溯到授权或本人同意;真人音色、品牌标识、受版权保护角色和新闻影像不能因为在本地生成就失去限制。官方 API 会自动审核输入与增强提示,但过滤可能误判,且不替用户承担许可证和法律责任;本地工作流则需要创作者自己建立审核、来源记录与发布标识。把开放范围、复现实验和权利清单放在同一张表里,H3 才能成为可持续的生产工具,而不是又一轮“2K 开源神器”的标题竞赛。