►文 观察者网 陈济深
“向 MiniMax 致敬。”
8月3日,Stable Diffusion 创始人 Emad Mostaque 在社交平台留下这句评价。彼时,MiniMax 刚刚正式开放视频模型 H3 的核心权重。
四年前,Stable Diffusion 首次将高质量图像生成技术从少数科技巨头的服务器中解放出来,直接交付给全球开发者与创作者。这一举动重塑了行业格局。
几乎在同一时刻,硅谷顶级投资机构 a16z 的合伙人 Justine Moore 也按捺不住激动之情,晒出了自己的实测数据。她震惊于模型的表现,言语间满是惊叹。
过去一年半里,她始终用一道看似简单的题目来测试各类 AI 视频模型:让画面中的男子用粉笔在黑板上写下“Hi”。在此之前,没有任何模型能完美通过这项测试——直到 H3 横空出世,一举攻克了这一难关。
对普通人来说,这不过是个寻常动作;但对视频模型而言,它需在连续时间流中同时处理手、粉笔与黑板的接触关系,理清笔画出现的先后顺序,更要确保已写出的字母不会随画面变化而扭曲或消失。
一位是生成式 AI 开放运动的标志性人物,另一位是长期关注产业竞争的硅谷投资人。两人同时对一家中国公司给予高度评价,显然并非因为市面上又多了一款头部视频模型。
真正引发关注的,是一个以往罕见的组合:世界第一梯队的视频生成能力,不再被锁在闭源产品和高价接口背后,而是以开源形式交到了开发者手中。
这让人不禁联想到 2025 年 DeepSeek-R1 发布时带来的开源震撼。
从文本延伸至视频,中国 AI 企业的持续开放,正将单点突破凝练为明确的技术范式。
视频,曾是 AI 最难打开的门
过去几年,开源语言模型走出了一条相对清晰的路径。
从美国的 Llama 到中国的 DeepSeek,开源模型性能不断提升,量化、微调及本地部署工具也日趋成熟。如今,企业乃至个人开发者在本地运行具备实用能力的语言模型,已不再令人意外。
但在视频赛道,光景截然不同。
文本模型输出的主要是一串 token,而视频模型需同时解决空间与时间问题。一个人物在连续数百帧中不能突然换脸,服饰、场景和光线不能随意漂移,动作必须承接前后状态,镜头还要准确执行人的创作意图。
若要做到音画同步,对白、环境音与配乐更需要与画面进行毫秒级的时空匹配。
这使得视频成为生成式 AI 中计算最密集、工程链条最复杂的领域之一。视频生成不仅推理负担沉重,容错率也极低——文字错了一句可以局部修改,而视频动作一旦出错,往往意味着整段重来,之前消耗的算力全部作废。
因此,前沿视频能力长期主要存在于云端产品和付费接口中。视频赛道的开源模型并非没有,但真正稀缺的是:一个开源模型,能不能同时站上全球商业竞争的最前沿?
MiniMax 发布的 H3 跨过的正是这道门槛。
在全球 AI 模型评测平台 Artificial Analysis 的评测中,H3 的视频编辑位居第一、文生视频排名第二、图生视频排名第三;在视频模型对战平台 Arena 的最新结果中,它成为文生视频和图生视频两类排名最高的开源模型。
更值得注意的是性能与成本的组合。Artificial Analysis 的数据显示,H3 的 2K 音视频生成价格约为每分钟 7.8 美元,低于当下多款 1080p 主流商业模型,在质量与价格象限中跻身最优梯队。
在过去,音画同步直出对于闭源模型都称得上核心竞争力。而 H3 同时把行业顶级的性能、极高的性价比和全面开源带到了同一张牌桌上,完成了视频领域的 DeepSeek 级突破。
用户还可以同时输入图片、视频和音频作为参考素材,让模型在一套系统内完成从画面生成到声音匹配的完整流程,而过去这通常需要在多个模型和软件之间反复切换。MiniMax 开放的,不只是一项单一功能,而是一种理解并执行复杂视听意图的生产力。
从 DeepSeek 到 MiniMax,开源正在变成行业引擎
DeepSeek 证明了高性能、低成本与开源权重可以同时成立;H3 的出现,则把这套逻辑推进到了 AI 研发门槛最高、也最具商业价值的另一高地:创意生产力。
H3 开放当天,包括华为昇腾、AMD、Intel 在内的国内外芯片厂商迅速完成适配,Hugging Face、魔搭 ModelScope、ComfyUI 等平台同步接入,多个主流推理框架也提供支持。在 Hugging Face 上,H3 一度升至趋势榜首,与 DeepSeek 最新模型共同占据前列。
开源 AI 工作流平台 ComfyUI 对 H3 的优化就是一个缩影。通过一系列工程优化,其方案把模型的总体内存占用从 123.6GB 降至 42.5GB,使消费级显卡也有机会本地运行前沿视频模型。
过去,开源模型经常是“够用但不是最好”的次优选择。真正追求效果的企业,最终仍要回到更强的闭源模型。
DeepSeek 在文本领域打破了这条分界线。
DeepSeek V4 Flash 发布时,每百万 token 输出定价仅 2 元人民币;而 OpenAI 的 GPT-5.6 Luna 即便经过 80% 的大幅降价,输出定价折合人民币仍要约 8.7 元。开发者社区由此喊出了“斩杀线”这个说法:当开源模型的性能达到准一线水平,价格却只要对手的零头,闭源产品就必须证明自己贵得有道理。
如今,MiniMax H3 正在视频领域画出同样一条线。H3 以 2K 分辨率音视频直出,每分钟生成成本约 7.8 美元;而当下多款主流闭源视频模型仅提供 1080p 输出,每分钟定价却在 20 美元以上。
更高的画质,不到对手四成的价格,再加上全面开源——这意味着,闭源视频模型昂贵的定价逻辑正在被彻底动摇。
过去,用户为封闭接口付费是因为没有同等水平的替代品;现在,替代品不仅出现了,而且更便宜、更开放,开发者还可以自行部署和优化。开源不再是退而求其次,封闭也不再天然等于能力领先。
中国正在把产业能力带入 AI 竞争
无论是 DeepSeek 还是 MiniMax,它们的开源选择背后都折射出一种正在形成的中国 AI 发展路径。
DeepSeek 和 MiniMax 面对不同领域与商业模式,却共同强化了一组越来越清晰的中国模型特征:世界级性能、持续降本、开源权重、工程优化与广泛适配。
这条发展路径并非凭空出现。
中国拥有高度竞争的电商、短视频、游戏、广告和内容产业。市场不只关心模型能否生成惊艳样片,更关心它是否便宜、稳定,能否批量运行,能否接入真实业务。
与此同时,中国拥有高度成熟的工程化落地能力与正在成长的国产算力生态。开源模型可以被不同芯片、框架、云平台和行业软件反复优化,将实验室里的能力快速挤掉水分,变成真正的生产工具。
这种路径,与中国过去推动光伏、电池、通信设备等技术普及的方式有某种相似之处。真正改变全球市场的,从来不只是性能最强的单个样品,也包括把复杂技术工程化、规模化,通过产业协作持续降低使用门槛的行业生态和土壤。
如今,这种能力正在进入 AI。
在全球最大的 AI 模型调用平台 OpenRouter 上,文本模型周调用量前十名中有八个来自中国;Hugging Face CEO Clément Delangue 近期表示,中国已经在开源模型领域占据主导地位。英伟达 CEO 黄仁勋也强调,世界既需要前沿闭源模型,也需要前沿开源模型,因为 AI 最终将“由每个国家构建”。
这种开放的生态,正在让全球开发者得以站在中国开源模型的肩膀上,建立属于自己的 AI 能力。
如果这一趋势持续下去,中国 AI 对世界的影响就不会只表现为排行榜上多了几个中国名字。它还可能表现为,越来越多国家与企业在建立自己的 AI 能力时,底层运行的是中国开源模型;越来越多开发者在设计下一代产品时,首先想到的是来自中国的模型底座。
中国由此输出的,不只是可以消费的技术产品,也是可以继续开发、继续创造的基础能力。
对于 MiniMax 的开放姿态,资本市场也并未将其解读为商业价值的让渡,反而给予了积极反馈。H3 发布后 MiniMax 股价连续走强,8月6日正式纳入港股通,华尔街投行杰富瑞重申买入评级,花旗同样维持买入。
从追赶前沿,到为世界增加一种选择
就在几个月前,全球视频 AI 领域还经历了一次标志性的退场。
2026年3月,OpenAI 关停了上线不久的 Sora,并终止了与迪士尼的巨额合作。这款曾惊艳世界的闭源代表作,最终因日均高达百万美元的推理成本而难以为继。
Sora 的退场并非技术失败,但它揭示了闭源视频模型面临的深层困境:推理成本极高,却只能由一家公司独自承担;用户只能调用接口,无法参与优化和适配;当热度退去,昂贵的算力基础设施就变成了沉重的财务负担。
H3 的出现,让一个判断变得越来越清晰:
在视频这个推理成本最高、工程链条最复杂的 AI 领域,闭源可能从一开始就不是最优解。
当模型足够强大后,谁能让它以更低成本、更可持续的方式进入现实世界?
从 DeepSeek 到 MiniMax H3,这条路已经从文本延伸到了成本更高、工程更复杂、与文化和产业结合更直接的视频领域。
从语言智能到视频生成,从模型产品到产业底座,中国 AI 正在完成一次重要的身份变化:它不再只是既有路线的追赶者,也开始为全球 AI 的发展提供另一种可能。
而这条路,中国可能从一开始就走对了。







