苏剑林写了 《简单谈谈 K3 的 MoE 和 Attention》。读完之后,最自然的冲动是复述:SiTU、升维前 Norm、QB、MLA 四约束、NoPE……这些点本身就够一篇技术笔记。
但那样写没有增量。苏已经把工程动机和消融写清楚了。
我更想问的是另一件事:
如果 DeepSeek V4 的三道防线,是在给一条先天有裂缝的流形搭脚手架——那 K3 的 Stable LatentMoE 和 Attention 取舍,能不能放进同一套坐标系里读?
本文提出一种统一读法:同一张病历,两套药。 这不是在声称 K3 与 V4 的实验室已经形成几何共识,而是把两边并排放进我此前 tear 系列的三轴框架,看哪些现象对齐、哪些只是配方分叉。
本文接续的两篇旧文:DeepSeek V4 与流形撕裂、训好的 MoE,撕裂有多严重?。
下文把证据分成三层:官方事实(K3 / V4 报告与架构表)、苏文解读、我的几何读法。后两层不自动升级成实验室结论。
1. 同一张病历(读法,不是判决)
训练大模型时反复出现的事故,粗看像三件无关的事:
- 激活炸了:SwiGLU 两路同时与输入对齐时,门控与线性支路的乘法放大会造成 outlier,loss 冲天。
- 路由歪了:top-k 专家选择是离散决策;相邻 token 落在边界两侧,层输出可以 跳变——这是真正的 撕裂,不是陡坡。
- 小错堆大了:上游一点不一致,经几十层 residual 放大,变成下游 loss spike。
在 V4 那篇 里,我把这三件事压成三轴(我的坐标系):
| 阶段 | 几何含义(读法) | V4 侧可见的药 |
|---|---|---|
| 局部曲率 / 激活失控 | 离开 chart 有效域,一阶近似崩 | SwiGLU hard clamp |
| 图册 / 路由不一致 | 路由决策与当前表示不同步 | Anticipatory Routing 等 |
| 跨层放大 | residual 传输若不加约束,扰动可堆叠 | mHC(见下:约束的是 residual mixing) |
官方叙事并不使用这套词。K3 谈的是 activation explosion、scale variation、expert load imbalance;V4 对 Anticipatory Routing 与 clamping 的原理也坦白仍未充分理解。
把它们并进三轴,是读法选择,不是转述 lab 自述。
架构一句话(苏文):
K3 = KDA + MLA + Stable LatentMoE + AttnRes
优化器仍是 Moonlight 版 Muon;Attention 投影的 Muon 更新改为按 head 分别处理——苏文侧重 head 更新不宜强行耦合;K3 报告 侧更强调平衡各 head 的 update scale、改善大规模训练稳定性,并略减开销。这里写成「解耦 head 更新尺度」,不强称「正确性证明」。
2. 对照表
| 轴 | DeepSeek V4 | Kimi K3 | 在本读法下的对照 |
|---|---|---|---|
| 激活 | SwiGLU hard clamp(硬边界) | SiTU / SiTU-GLU softcap(软边界) | 都在限制激活失控;边界是硬壁还是光滑软帽不同 |
| 路由 / 专家 | Anticipatory Routing 等 | LatentMoE(降维后更多专家、更高 top-k)+ QB 负载均衡 | 一边偏时序一致的路由决策,一边偏可扩展的 latent 路由与流量公平 |
| 跨层 / 块内稳定 | mHC:residual mixing 约束为双随机 | 升维前 RMSNorm(+ AttnRes) | 不同位点的稳定补丁,对象不完全相同 |
| Attention 路线 | 交错 CSA(Compressed Sparse Attention)与 HCA(Heavily Compressed Attention) | KDA + MLA 混合,MLA 上 NoPE | Sparse/压缩极致 vs Linear+Full 混合 |
下面逐行展开。
3. 激活:硬壁还是软边界
V4:hard clamp
V4 把激活和门控夹在有限区间里。
我的读法: 任何 chart 只在局部有效;越界则一阶近似失效。Clamp 是在声明「别离开地图」。
K3:SiTU softcap
传统 MoE Expert 通常使用 SwiGLU:
两路线性各随输入尺度增长;再经门控与逐元相乘,会出现乘法放大的异常激活(不必诉诸四次方)。K3 先把 SiLU 换成 SiTU(Sigmoid Tanh Unit):门控 softcap 到 ;再给线性支路 softcap,形成 SiTU-GLU(苏文 )。
苏对比 GPT-OSS、DSV4 的 hard clip:同界限下 softcap 往往更好。
增量命题(hypothesis)
若只说 “bound the activation”,会漏掉边界形状:
- Hard clip 本身连续且 1-Lipschitz,不引入函数值的有限跳变;它在阈值处通常不是 ,阈值外梯度为零——制造的是 kink 与饱和,不是新的 tear。
- Softcap 用光滑软边界压幅度,减少死梯度平台,曲率行为更温和。
两边都在「别离开地图」。差异在于——边缘是硬折角与饱和平台,还是缓坡护栏。
因此:可以比较饱和比例、边界邻域的梯度/曲率集中;不应预期 hard clip 会在 hardG 意义上交出一道函数跳变墙。此前若把 soft/hard 写成「次级 tear」,对象选错了——命题收回,对照保留。
4. 路由:Latent 空间里的离散选择
标准 MoE 的撕裂(测量侧)
标准 top-k:隐藏态 ,router 打分;第 与第 名 router score 相交的边界上,块输出可 跳跃。我在 OLMoE / Qwen 开放权重上量过:撕裂是真的。
LatentMoE:改决策空间,不取消离散
苏文与 K3 报告 的结构对照:
- 标准 MoE:,n 选 k
- LatentMoE:先降到更低维 latent,再在更大专家池上做更高 top-k,最后升维
正式规模(勿与中间实验基线混淆):
| Routed experts | 激活数 | 稀疏因子(experts / active) | |
|---|---|---|---|
| K2 | 384 | 8 | 48 |
| K3 | 896 | 16 | 56 |
不是「448→8 再翻倍且稀疏度不变」。若苏文出现 448 一类数字,应理解为设计推演或中间设定,不是 K2→K3 官方架构表。稀疏因子从 48 到 56,稀疏度略有提高,不是不变。
代价:降维、MoE、升维串连,尺度与稳定性更难。K3 在升维前保留 RMSNorm。官方报告 的表述是:该 Norm consistently improves validation loss and downstream benchmarks——不是「Valid Loss 差不多、只 benchmark 变好」。苏文还补充了 routed/shared 比例与弱非线性等效加深等直觉,那些算解读层。
负载:专家池变大后,Loss-Free 路线保留,但 SignSGD 式更新在更大规模上不稳,换成 QB(Quantile Balancing),直方图分 bin 近似全局分位数(苏文约 1000 bin 够用)。
在本读法下意味着什么
- top-k 的 结构没有被官方写成「已治愈」——K3 官方问题定义是 explosion、scale、imbalance;把 Latent/QB 读成「治 tear」,是我的外推,须标成 hypothesis。
- 选择发生在更低维 latent、专家池与 k 都更大 → how-torn 的 M1/M2/M3 值得在 Latent 设定上重跑,那是测量续篇,不是本篇已有的数。
- 升维前 Norm 是连续补丁贴在离散路由块边上:不改 top-k 逻辑,也能改尺度与分工。
- QB 是大规模流量分配问题;和「容量约束下的公平分配」同族,不必硬说成几何 tear 疗法。
V4 的 Anticipatory Routing 侧重决策时序;K3 的 Latent + QB 侧重空间扩展与负载均衡。轴不同,都在让离散专家系统可训——并排放有启发,合并成「同一治疗靶点」则过度。
5. Attention:两条路线,不是一句 Sparse
四个同时要满足的条件(苏文)
- 效果不能差于 MLA
- 训练和 Prefill 成本不超过 MLA
- KV Cache 比 MLA 小(超长文)
- Decoding 计算量比 MLA 小(对 MTP / 推测解码友好)
苏的判断:目前没有简单设计同时占满 1–4。在 KDA 混合下,MLA 部分短板被缓解,故 K3 仍选 MLA。
读 V4 Attention:CSA + HCA,不是笼统 Full-ish
更精确的说法(见 DeepSeek V4 架构说明):
- CSA(Compressed Sparse Attention):压缩表示上的稀疏选择
- HCA(Heavily Compressed Attention):重度压缩后不再做 sparse selection——不是「原序列上的 Full-ish attention」
「Sparse + Compress 极致」可作一句总结,但两类层的分工不同。苏文将 DSV4 读成「把 MLA 的 decode 形态推到极致再靠压缩/稀疏压成本」——这是高层次谱系读法,有助于和 K3 的 Linear+Full 对照;细节以官方层类型为准。
NoPE:官方结论短,几何延伸是我的
K3 的 MLA 去掉 RoPE。关键事实:
- 全 MLA 设定下去 RoPE 通常伤效果(K2 脉络)
- KDA+MLA 混合下,加回 RoPE 几乎无增益 → 最简原则去掉
K3 报告 支持的较弱结论:KDA 提供 position-sensitive、recency-aware 的顺序混合,故周期性 MLA 层可以用 NoPE。
苏文进一步借助 PaTH / Householder / DeltaNet 讨论广义位置结构——有启发。
我的额外一步(hypothesis,非官方):把它理解为「位置职责可部分外包给 linear 支路的动力学」,并延伸到 connection 的语言。证据到 KDA 的顺序混合为止;再往后是坐标系延伸,不是报告原句。
两条长上下文路线(对照用)
| 路线 | 代表 | 策略(粗) |
|---|---|---|
| 压缩 + 稀疏交错 | V4:CSA / HCA | 压 KV 与算力,层类型分工 |
| Linear + Full 混合 | K3:KDA + MLA | linear 扛效率与顺序混合,MLA 扛表达 |
谁更远,开放问题。并排是为了读下一份 tech report 时有坐标,不是押注。
6. 在这套读法下对齐的,和仍是配方的
对齐的现象(读法层,不是 lab 联署):
- 无界或过猛的激活会破坏稳定训练
- 离散专家选择带来真不连续结构(是否被官方列为首要靶点是另一回事)
- 跨层 / 块间传输需要稳定补丁
- Attention 是多目标约束,不是单点「最新模块更好」
- 架构补丁多半是脚手架;数据与表示是否先天平滑,仍是另一层问题(V4 文 的 Max Ma 论点,仍作开放天花板)
配方分叉:
- 边界:hard clamp vs softcap(kink/饱和 vs 光滑软帽)
- 稳定:mHC 的 residual mixing 双随机约束 vs Latent 升维前 RMSNorm
- 路由:时序一致决策 vs latent 扩展 + 分位均衡
- 长上下文:CSA/HCA vs KDA+MLA
Frontier 实验室是否「先承认网络是几何对象再上约束」——这是我的归纳,不是已证实的集体共识。 能说的是:Muon、mHC、SiTU、QB、Anticipatory Routing 名字不同,都在给难训的离散/深层系统加约束;并排放进同一坐标系有用。
苏文方法论仍值得记:最小改动、一次少加变量、每处有消融。这和「可测诊断 + 最小脚手架」遵循同一种工程纪律,不依赖几何词表。
mHC 一句收窄
严格成立的是:mHC 把 residual-stream mixing 矩阵约束在双随机集合上,故该混合谱范数 ≤ 1(非膨胀)。完整层仍是
非线性分支 不会因此自动变成整层 Lipschitz-1。对照表里应写「约束纯 residual transport 非膨胀」,而不是「层间扰动不可能放大」。
7. 还没量、但该量的
- Softcap vs hard clip:比饱和、边界梯度/曲率,不要用 hardG 找函数跳变。
- LatentMoE 上的 M1/M2/M3:降维路由与更大专家池后,cliff 与边界占比如何变;升维前 Norm on/off 对块输出尺度与跳变的影响。
- 开放权重谱系:能拿到的 hybrid / compressed-attention 权重,是否支持「两条路线」的粗图像。
有数之前,几何读法是坐标系,不是判决书。
8. 收束
K3 与 DeepSeek V4 不必互相消灭。
- V4 把训练稳定性推成一组几乎可命名的工程防线。
- K3 把 MoE 可扩展性 + Attention 多目标取舍 写成不炫技、可消融的增量。
并排放:不是两份互斥的「正确架构」,而是同一类工程压力下的两种脚手架——硬边界与软边界、时序路由与 latent 扩展、压缩稀疏交错与 Linear+Full 混合。
数据与表示是否先天平滑,两边都还没有终局答案。
两条长上下文路线谁更远,也还没有终局答案。
眼下更有用的,是带着这张作者提出的坐标系去读下一份 tech report:先问它压的是激活、路由还是跨层;再问补丁是硬约束还是软约束;最后才问 benchmark 数字。
依据分层:官方——Kimi K3 技术报告、Kimi-K3 架构说明、DeepSeek V4 文档、mHC 论文;解读——苏剑林 《简单谈谈 K3 的 MoE 和 Attention》;坐标系——本站 DeepSeek V4 与流形撕裂 与 训好的 MoE,撕裂有多严重?。