← Back to blog
Jul 29, 20265 min read1478 words

Kimi K3 是如何训练出来的?2.8万亿参数模型的深度技术分析

AILLM技术分析开源

2026 年 7 月 27 日,月之暗面(Moonshot AI)发布了 Kimi K3——一个 2.8 万亿参数的混合专家(MoE)模型,并完全开源了全量权重。这是开源社区第一个真正达到 3T 级别的模型,在多项基准测试中超越了 Claude Opus 4.8 和 GPT-5.5,直逼最顶尖的闭源模型。

本文基于 Kimi 团队发布的 47 页技术报告,深度解析 K3 是如何训练出来的。

核心参数

指标数值
总参数2.8T(2.8 万亿)
激活参数104B(每 token)
架构MoE,896 专家,16 激活/token
上下文1M tokens
视觉原生多模态
缩放效率相比 K2 提升 2.5 倍
训练精度MXFP4 权重 / MXFP8 激活

一、架构创新:三个维度的信息流革命

Kimi K3 相比于前代 K2 拥有约 2.5 倍的缩放效率提升,这并非简单地堆参数,而是重新设计了信息在模型内部流动的方式。

1. 混合注意力:KDA + Gated MLA(3:1)

每个 Block 中,3 层 KDA(Kimi Delta Attention)+ 1 层 Gated MLA 交替堆叠。这意味着 75% 的层使用线性注意力,仅 25% 保留传统全局注意力。

KDA 的核心思想:把历史上下文压缩成固定大小的记忆状态矩阵,通过通道级遗忘门控制记忆衰减。最关键的是——K3 在所有层完全移除了 RoPE 位置编码(NoPE),位置信息完全由 KDA 的衰减机制隐式承载。这是第一个在 Frontier 级别做到全 NoPE 的模型。

Gated MLA 负责需要精确检索的时刻,继承 DeepSeek-V2 的 KV 压缩设计,但增加了全秩输出门控,训练时使用 FP32 保持注意力输出精度。

2. 注意力残差(AttnRes)

随着模型越来越深,前面层的信息会逐渐稀释。AttnRes 让每一层可以通过深度维度上的注意力,选择性检索前面任意层的信息。相当于在深度维度上也做了一次"注意力"。

为了降低开销,采用 Block AttnRes:93 层拆分为 8 个 Block(每块 12 层),块内累加,块间做全注意力,内存开销从 O(Ld) 降到 O(Nd)。增加了约 4% 训练成本、2% 推理成本,但 loss 和下游表现稳定提升。

3. Stable LatentMoE

896 个路由专家,16 激活/token,稀疏度 56。三项稳定化创新:

4. 原生视觉:MoonViT-V2

27 层约 4 亿参数视觉 Transformer。完全摒弃 SigLIP/CLIP 对比预训练初始化,直接从头做 next-token prediction。文本和图像从零开始联合训练。

二、预训练:四阶段渐进式扩展

数据:网页文本、代码、数学、知识 + 大规模视觉数据(SVG、3D 资产、网页游戏、CAD 图纸等)。

关键发现:在独立超参数搜索中,Cosine 衰减调度始终优于 WSD(Warmup-Stable-Decay),这直接影响了最终预训练 loss 的下限。

上下文扩展:四阶段渐进式——8K→64K→256K→1M。核心策略是把昂贵的长序列计算集中在极小比例预算中,而非全程使用长上下文。

三、后训练:这才是真正的"秘密武器"

很多模型在预训练上差距不大,真正的分野在后训练。K3 的后训练是三层结构:

SFT → Multi-effort RL → MOPD 蒸馏

训练 9 个专家模型

不是训一个模型,而是训 9 个领域-努力程度专家

维度分类
领域通用 / 通用 Agent / 编程 Agent
推理努力low / high / max
总数3 × 3 = 9

Partial Rollout

当 λNK 比例的 trajectory 完成时暂停生成,启动 policy 优化,未完成的存入可恢复沙盒。解决超长 Horizon 任务的拖后腿问题。

MOPD 融合

Multi-Teacher On-Policy Distillation——9 个专家能力通过在线 OPD Reward 无损融合成单一 K3 模型。这是当前最先进的模型融合范式,DeepSeek 也在用类似方法。

RL 环境的丰富性

四、基础设施:软硬件协同设计

五、性能定位

对比结果
vs Claude Fable 5落后
vs GPT-5.6 Sol落后
vs Opus 4.8超越
vs GPT-5.5超越
WebDev Arena全球第一(1678 Elo,首个登顶的开源模型)
GPQA Diamond93.5%(仅落后 GPT-5.6 Sol 0.6%)
SWE-Marathon42.0%(大幅领先 Fable 5 的 35.0%)

六、对行业的启示

  • MoE 是通往 3T+ 的必经之路,但需要 SiTU-GLU + QB 等配套稳定化技术

  • 后训练从"调参"变成"系统工程"——9 专家 + MOPD 比简单 RLHF 复杂一个数量级

  • 推理效率 = 核心竞争力——KDA 线性注意力 + 细粒度 Caching 让 2.8T 模型服务成本可控

  • 开源正在逼近闭源——K3 在大多数 benchmark 上超越 Opus 4.8 和 GPT-5.5

  • Agent 能力是新的 Benchmark——不只是刷分,而是真正能做长程工程任务

  • 参考资料: