Kimi K3 是如何训练出来的?2.8万亿参数模型的深度技术分析
2026 年 7 月 27 日,月之暗面(Moonshot AI)发布了 Kimi K3——一个 2.8 万亿参数的混合专家(MoE)模型,并完全开源了全量权重。这是开源社区第一个真正达到 3T 级别的模型,在多项基准测试中超越了 Claude Opus 4.8 和 GPT-5.5,直逼最顶尖的闭源模型。
本文基于 Kimi 团队发布的 47 页技术报告,深度解析 K3 是如何训练出来的。
核心参数
| 指标 | 数值 |
|---|---|
| 总参数 | 2.8T(2.8 万亿) |
| 激活参数 | 104B(每 token) |
| 架构 | MoE,896 专家,16 激活/token |
| 上下文 | 1M tokens |
| 视觉 | 原生多模态 |
| 缩放效率 | 相比 K2 提升 2.5 倍 |
| 训练精度 | MXFP4 权重 / MXFP8 激活 |
一、架构创新:三个维度的信息流革命
Kimi K3 相比于前代 K2 拥有约 2.5 倍的缩放效率提升,这并非简单地堆参数,而是重新设计了信息在模型内部流动的方式。
1. 混合注意力:KDA + Gated MLA(3:1)
每个 Block 中,3 层 KDA(Kimi Delta Attention)+ 1 层 Gated MLA 交替堆叠。这意味着 75% 的层使用线性注意力,仅 25% 保留传统全局注意力。
KDA 的核心思想:把历史上下文压缩成固定大小的记忆状态矩阵,通过通道级遗忘门控制记忆衰减。最关键的是——K3 在所有层完全移除了 RoPE 位置编码(NoPE),位置信息完全由 KDA 的衰减机制隐式承载。这是第一个在 Frontier 级别做到全 NoPE 的模型。
Gated MLA 负责需要精确检索的时刻,继承 DeepSeek-V2 的 KV 压缩设计,但增加了全秩输出门控,训练时使用 FP32 保持注意力输出精度。
2. 注意力残差(AttnRes)
随着模型越来越深,前面层的信息会逐渐稀释。AttnRes 让每一层可以通过深度维度上的注意力,选择性检索前面任意层的信息。相当于在深度维度上也做了一次"注意力"。
为了降低开销,采用 Block AttnRes:93 层拆分为 8 个 Block(每块 12 层),块内累加,块间做全注意力,内存开销从 O(Ld) 降到 O(Nd)。增加了约 4% 训练成本、2% 推理成本,但 loss 和下游表现稳定提升。
3. Stable LatentMoE
896 个路由专家,16 激活/token,稀疏度 56。三项稳定化创新:
- SiTU-GLU:用 β·tanh(x/β) 做软上限,门控分支 β₁=4,上投影分支 β₂=25,输出上限严格控制在 100。这是针对 3T 级别训练中激活值爆炸的"保险丝"
- RMSNorm:在路由专家聚合与上投影之间插入归一化
- Quantile Balancing (QB):无需辅助损失的路由负载均衡,从路由得分分位数直接计算 bias 偏置,一步到位
4. 原生视觉:MoonViT-V2
27 层约 4 亿参数视觉 Transformer。完全摒弃 SigLIP/CLIP 对比预训练初始化,直接从头做 next-token prediction。文本和图像从零开始联合训练。
二、预训练:四阶段渐进式扩展
数据:网页文本、代码、数学、知识 + 大规模视觉数据(SVG、3D 资产、网页游戏、CAD 图纸等)。
关键发现:在独立超参数搜索中,Cosine 衰减调度始终优于 WSD(Warmup-Stable-Decay),这直接影响了最终预训练 loss 的下限。
上下文扩展:四阶段渐进式——8K→64K→256K→1M。核心策略是把昂贵的长序列计算集中在极小比例预算中,而非全程使用长上下文。
三、后训练:这才是真正的"秘密武器"
很多模型在预训练上差距不大,真正的分野在后训练。K3 的后训练是三层结构:
SFT → Multi-effort RL → MOPD 蒸馏
训练 9 个专家模型
不是训一个模型,而是训 9 个领域-努力程度专家:
| 维度 | 分类 |
|---|---|
| 领域 | 通用 / 通用 Agent / 编程 Agent |
| 推理努力 | low / high / max |
| 总数 | 3 × 3 = 9 |
Partial Rollout
当 λNK 比例的 trajectory 完成时暂停生成,启动 policy 优化,未完成的存入可恢复沙盒。解决超长 Horizon 任务的拖后腿问题。
MOPD 融合
Multi-Teacher On-Policy Distillation——9 个专家能力通过在线 OPD Reward 无损融合成单一 K3 模型。这是当前最先进的模型融合范式,DeepSeek 也在用类似方法。
RL 环境的丰富性
- 可配置组装为 Kimi Code、Claude Code、Codex 等主流 Agent 构型
- 知识图谱引导的任务合成
- GPU 内核优化任务(CUDA、Triton、TileLang)+ 反作弊机制
- 模拟 Gmail/Notion/Slack 的多天长程交互
- 整个训练过程创建超过 5121 万个沙盒
四、基础设施:软硬件协同设计
- MoonEP:理论证明每台机器只需保留最多 E/R 个冗余专家,就存在完美负载均衡。零拷贝通信,静态 Shape 消除同步
- FlashKDA:基于 CUTLASS,重叠块内计算与跨块状态传播
- AgentENV:基于 Firecracker 的 MicroVM 沙盒,暂停/恢复延迟低至 133ms/49ms,支持 6.5 倍内存超分
- 推理优化:细粒度 Prefix Caching,编程场景 Cache 命中率 > 90%
五、性能定位
| 对比 | 结果 |
|---|---|
| vs Claude Fable 5 | 落后 |
| vs GPT-5.6 Sol | 落后 |
| vs Opus 4.8 | 超越 |
| vs GPT-5.5 | 超越 |
| WebDev Arena | 全球第一(1678 Elo,首个登顶的开源模型) |
| GPQA Diamond | 93.5%(仅落后 GPT-5.6 Sol 0.6%) |
| SWE-Marathon | 42.0%(大幅领先 Fable 5 的 35.0%) |
六、对行业的启示
参考资料: