7月27日晚,Kimi K3开放日如期举行。月之暗面不仅公开了Kimi K3模型的权重与技术报告,还同步开源了三款关键基础设施,分别用于支撑模型训练与运行:针对超大规模MoE通信的MoonEP、面向线性注意力的FlashKDA,以及服务于长周期智能体强化学习的AgentEnv。
短短一天时间,公众对K3的关注点逐渐从技术细节转向更深层的疑问:这些公开内容,能否真正说清K3为何突然变强?又能否让K3摆脱“蒸馏Claude”的质疑?
严格来讲,这次K3属于开放权重,并未完全达到传统意义上的开源标准。但凭借2.8万亿总参数和约1042亿激活参数,它依然是目前规模最大、能力最贴近闭源旗舰的开放权重模型之一。
这份技术报告的发布时机颇为恰当。
此前,Anthropic及部分美国官员指控月之暗面大规模获取Claude输出,并将相关能力用于Kimi模型训练。中国商务部随即回应,指出美方关于蒸馏和窃取知识产权的说法缺乏实际证据和法律支撑,并反对以此为由对中国AI企业进行调查或制裁。
争议焦点并非K3训练中是否使用了蒸馏技术——毕竟这是大模型行业的通用手段——而是K3是否以工业级规模蒸取了Claude最新模型的海量数据。
如今,月之暗面首次较为系统地展示了K3的技术全景:更大的混合专家模型、重构的注意力与残差结构、百万Token级别的智能体强化学习,以及覆盖通用任务、智能体和编程任务的九个专业策略。
图片来自AI生成
**K3为何突然变强**
Kimi K3采用混合专家架构,总参数量达2.8万亿。模型内部包含896个路由专家,每个Token会从中选出16个,同时调用两个共享专家,实际激活参数约为1042亿。
对比拥有1.04万亿总参数、326亿激活参数的Kimi K2,K3不仅将总容量扩大至近2.7倍,单次计算调用的参数也翻了两倍以上。
规模扩张是解释K3能力提升的最直接线索,但月之暗面的答案并非单纯堆砌参数。
K3以3∶1的比例组合了Kimi Delta Attention与Gated MLA。简而言之,前者能以较低的缓存成本处理长上下文,后者则定期执行全局信息交互,从而在效率与能力间取得平衡。这种混合结构助力K3将原生上下文窗口扩展至约100万Token。
Attention Residuals旨在解决深层模型中的信息稀释问题。传统模型主要逐层传递信息,而K3可以有选择地调用此前网络区块的表示,使早期重要信息更直接地影响后续计算。
Stable LatentMoE进一步扩大了专家空间,同时仅让少数专家参与每次计算。这样既能增加知识容量,又无需让全部2.8万亿参数同时运行。月之暗面表示,K3相较K2实现了约2.5倍的整体扩展效率提升。
一位业内人士指出,这些技术并未完全消除复杂性,而是将部分复杂性转移到了更底层的AI Infra层面。更多专家意味着更艰难的跨卡调度,KDA虽减少了长上下文的缓存压力,却引入了新的递归状态,Attention Residuals则增加了跨层信息的保存与传递,AI infra层的压力实则更大。
为此,月之暗面同步开放了MoonEP和FlashKDA。前者负责平衡超大规模MoE中的专家负载,后者帮助KDA更高效地在GPU上运行。这意味着K3的效率不只存在于模型权重中,还高度依赖于Kernel、通信、缓存和集群调度的协同配合。
权重开放后,这套系统已开始接受外部工程验证。例如,昇腾在7月28日宣布对K3进行0day适配,涵盖训练、推理、显存优化及MXFP4等数值格式;vLLM、SGLang和TokenSpeed也已提供运行支持。
不过,开放仅一天,社区大多仍处于调试阶段,尚未独立复现其2.5倍扩展效率、百万Token吞吐及长周期智能体表现。
因此,尽管技术报告提供了一套足以解释能力增长的架构,但其中一些关键结论仍源自月之暗面自身的实验。
**九个专业模型,如何教会一个K3**
相较于基础架构,K3的后训练流程可能更直接地解释了其在编程和智能体任务上的跃升。
据技术报告披露,月之暗面先通过监督微调建立冷启动模型,随后在通用任务、通用智能体和编程智能体三个方向进行强化学习。每个方向又分别训练low、high和max三档推理强度,由此形成九个专业教师策略。
最终,这九个专业模型通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation,MOPD),合并为统一的K3。
这里的“在线”,意味着学生模型并非简单模仿教师提前生成的一批答案。学生先按自身策略生成任务轨迹,再由相应领域和推理强度的教师提供反馈。这种方式更接近学生模型实际遇到的状态,也更容易将九套不同策略整合进一个模型。
多教师在线蒸馏并非K3首创。从公开资料看,小米MiMo团队在2025年12月发布MiMo-V2-Flash时,已明确使用并命名了Multi-Teacher On-Policy Distillation;多教师知识蒸馏和在线蒸馏的基础思路出现得更早。
K3的创新点不在于首先提出MOPD,而在于将其应用于由三个任务领域和三档推理强度组成的九教师体系。需要区分的是,技术报告中的MOPD与美国方面指控的Claude蒸馏并非同一回事。
按照报告披露的流程,MOPD阶段的直接教师,是九个由K3冷启动模型经过分领域强化学习形成的内部专业策略。报告中并未将Claude或Fable列为这一阶段的教师。
由于技术报告未完整披露预训练语料、监督微调数据、奖励模型数据和合成任务的来源,无法证明外部模型输出从未进入K3的训练流程。
独立评测显示,K3在Frontend Code Arena等评测中处于领先位置,在部分智能体和编程基准上接近或超过Claude、GPT系列;但在DeepSWE、FrontierSWE以及部分综合知识工作评测中,仍落后于Claude Fable 5或GPT-5.6 Sol。
**开放解释了能力增长,却没有还原数据来源**
今年2月,Anthropic表示,月之暗面、DeepSeek和MiniMax通过大量虚假账户及代理渠道获取Claude输出。三家公司累计产生超过1600万次交互,其中与月之暗面相关的活动超过340万次,目标涉及智能体推理、工具调用、编程、数据分析、计算机操作和计算机视觉。
美国白宫科技政策办公室主任近日表示,美方掌握的信息显示,月之暗面曾蒸馏Anthropic的Fable模型,用于K3开发。围绕“工业级蒸馏”的调查、制裁和实体清单措施,也被美国官员提上讨论桌面。
中国商务部则在7月27日作出直接回应,称美方忽略了中美相关模型发布时间间隔很短、中国模型已具备领先能力等事实,并指有关说法缺乏实际证据和法律依据。商务部同时表示,模型蒸馏是行业普遍使用的技术,美国企业也在研究和利用中国开放模型。
上述行业人士认为,Fable 5公开可用与K3发布之间时间极短,要在该时间段内完成海量数据获取、后训练、评测和产品部署,并以此解释K3的全部能力,并不符合超大模型通常的研发周期。
开放权重本身同样无法给出确切答案。2.8万亿参数的Stable LatentMoE、KDA与Attention Residuals、九教师MOPD、百万Token强化学习,以及MoonEP、FlashKDA和AgentEnv,共同构成了一条相对完整的能力增长路径。
月之暗面证明了一套足以生产前沿模型的架构、算法和基础设施,但尚无法自证蒸馏陷阱。









