博客

驯服不连续的两种药方:K3 与 DeepSeek V4

2026年8月9日

English

苏剑林写了 《简单谈谈 K3 的 MoE 和 Attention》。读完之后,最自然的冲动是复述:SiTU、升维前 Norm、QB、MLA 四约束、NoPE……这些点本身就够一篇技术笔记。

但那样写没有增量。苏已经把工程动机和消融写清楚了。

我更想问的是另一件事:

如果 DeepSeek V4 的三道防线,是在给一条先天有裂缝的流形搭脚手架——那 K3 的 Stable LatentMoE 和 Attention 取舍,能不能放进同一套坐标系里读?

本文提出一种统一读法:同一张病历,两套药。 这不是在声称 K3 与 V4 的实验室已经形成几何共识,而是把两边并排放进我此前 tear 系列的三轴框架,看哪些现象对齐、哪些只是配方分叉。

本文接续的两篇旧文:DeepSeek V4 与流形撕裂训好的 MoE,撕裂有多严重?

下文把证据分成三层:官方事实(K3 / V4 报告与架构表)、苏文解读我的几何读法。后两层不自动升级成实验室结论。


1. 同一张病历(读法,不是判决)

训练大模型时反复出现的事故,粗看像三件无关的事:

  1. 激活炸了:SwiGLU 两路同时与输入对齐时,门控与线性支路的乘法放大会造成 outlier,loss 冲天。
  2. 路由歪了:top-k 专家选择是离散决策;相邻 token 落在边界两侧,层输出可以 O(1)O(1) 跳变——这是真正的 C0C^0 撕裂,不是陡坡。
  3. 小错堆大了:上游一点不一致,经几十层 residual 放大,变成下游 loss spike。

V4 那篇 里,我把这三件事压成三轴(我的坐标系):

阶段几何含义(读法)V4 侧可见的药
局部曲率 / 激活失控离开 chart 有效域,一阶近似崩SwiGLU hard clamp
图册 / 路由不一致路由决策与当前表示不同步Anticipatory Routing 等
跨层放大residual 传输若不加约束,扰动可堆叠mHC(见下:约束的是 residual mixing)

官方叙事并不使用这套词。K3 谈的是 activation explosion、scale variation、expert load imbalance;V4 对 Anticipatory Routing 与 clamping 的原理也坦白仍未充分理解。
把它们并进三轴,是读法选择,不是转述 lab 自述。

架构一句话(苏文):

K3 = KDA + MLA + Stable LatentMoE + AttnRes

优化器仍是 Moonlight 版 Muon;Attention 投影的 Muon 更新改为按 head 分别处理——苏文侧重 head 更新不宜强行耦合;K3 报告 侧更强调平衡各 head 的 update scale、改善大规模训练稳定性,并略减开销。这里写成「解耦 head 更新尺度」,不强称「正确性证明」。


2. 对照表

DeepSeek V4Kimi K3在本读法下的对照
激活SwiGLU hard clamp(硬边界)SiTU / SiTU-GLU softcap(软边界)都在限制激活失控;边界是硬壁还是光滑软帽不同
路由 / 专家Anticipatory Routing 等LatentMoE(降维后更多专家、更高 top-k)+ QB 负载均衡一边偏时序一致的路由决策,一边偏可扩展的 latent 路由与流量公平
跨层 / 块内稳定mHC:residual mixing 约束为双随机升维前 RMSNorm(+ AttnRes)不同位点的稳定补丁,对象不完全相同
Attention 路线交错 CSA(Compressed Sparse Attention)与 HCA(Heavily Compressed Attention)KDA + MLA 混合,MLA 上 NoPESparse/压缩极致 vs Linear+Full 混合

下面逐行展开。


3. 激活:硬壁还是软边界

V4:hard clamp

V4 把激活和门控夹在有限区间里。
我的读法: 任何 chart 只在局部有效;越界则一阶近似失效。Clamp 是在声明「别离开地图」。

K3:SiTU softcap

传统 MoE Expert 通常使用 SwiGLU:

W3(SiLU(W1x)W2x)W_3\bigl(\mathrm{SiLU}(W_1 x)\odot W_2 x\bigr)

两路线性各随输入尺度增长;再经门控与逐元相乘,会出现乘法放大的异常激活(不必诉诸四次方)。K3 先把 SiLU 换成 SiTU(Sigmoid Tanh Unit):门控 softcap 到 (β,β)(-\beta,\beta);再给线性支路 softcap,形成 SiTU-GLU(苏文 β1=4, β2=25\beta_1=4,\ \beta_2=25)。

苏对比 GPT-OSS、DSV4 的 hard clip:同界限下 softcap 往往更好。

增量命题(hypothesis)

若只说 “bound the activation”,会漏掉边界形状:

  • Hard clip 本身连续且 1-Lipschitz,引入函数值的有限跳变;它在阈值处通常不是 C1C^1,阈值外梯度为零——制造的是 kink 与饱和,不是新的 C0C^0 tear。
  • Softcap 用光滑软边界压幅度,减少死梯度平台,曲率行为更温和。

两边都在「别离开地图」。差异在于——边缘是硬折角与饱和平台,还是缓坡护栏

因此:可以比较饱和比例、边界邻域的梯度/曲率集中;不应预期 hard clip 会在 hardG 意义上交出一道函数跳变墙。此前若把 soft/hard 写成「次级 tear」,对象选错了——命题收回,对照保留。


4. 路由:Latent 空间里的离散选择

标准 MoE 的撕裂(测量侧)

标准 top-k:隐藏态 hRdh \in \mathbb{R}^d,router 打分;kk 与第 k+1k{+}1 名 router score 相交的边界上,块输出可 C0C^0 跳跃。我在 OLMoE / Qwen 开放权重上量过:撕裂是真的。

LatentMoE:改决策空间,不取消离散

苏文与 K3 报告 的结构对照:

  • 标准 MoE:dDdd \to D \to d,n 选 k
  • LatentMoE:先降到更低维 latent,再在更大专家池上做更高 top-k,最后升维

正式规模(勿与中间实验基线混淆):

Routed experts激活数稀疏因子(experts / active)
K2384848
K38961656

不是「448→8 再翻倍且稀疏度不变」。若苏文出现 448 一类数字,应理解为设计推演或中间设定,不是 K2→K3 官方架构表。稀疏因子从 48 到 56,稀疏度略有提高,不是不变。

代价:降维、MoE、升维串连,尺度与稳定性更难。K3 在升维前保留 RMSNorm官方报告 的表述是:该 Norm consistently improves validation loss and downstream benchmarks——不是「Valid Loss 差不多、只 benchmark 变好」。苏文还补充了 routed/shared 比例与弱非线性等效加深等直觉,那些算解读层。

负载:专家池变大后,Loss-Free 路线保留,但 SignSGD 式更新在更大规模上不稳,换成 QB(Quantile Balancing),直方图分 bin 近似全局分位数(苏文约 1000 bin 够用)。

在本读法下意味着什么

  1. top-k 的 C0C^0 结构没有被官方写成「已治愈」——K3 官方问题定义是 explosion、scale、imbalance;把 Latent/QB 读成「治 tear」,是我的外推,须标成 hypothesis。
  2. 选择发生在更低维 latent、专家池与 k 都更大 → how-torn 的 M1/M2/M3 值得在 Latent 设定上重跑,那是测量续篇,不是本篇已有的数。
  3. 升维前 Norm 是连续补丁贴在离散路由块边上:不改 top-k 逻辑,也能改尺度与分工。
  4. QB 是大规模流量分配问题;和「容量约束下的公平分配」同族,不必硬说成几何 tear 疗法。

V4 的 Anticipatory Routing 侧重决策时序;K3 的 Latent + QB 侧重空间扩展与负载均衡。轴不同,都在让离散专家系统可训——并排放有启发,合并成「同一治疗靶点」则过度。


5. Attention:两条路线,不是一句 Sparse

四个同时要满足的条件(苏文)

  1. 效果不能差于 MLA
  2. 训练和 Prefill 成本不超过 MLA
  3. KV Cache 比 MLA 小(超长文)
  4. Decoding 计算量比 MLA 小(对 MTP / 推测解码友好)

苏的判断:目前没有简单设计同时占满 1–4。在 KDA 混合下,MLA 部分短板被缓解,故 K3 仍选 MLA。

读 V4 Attention:CSA + HCA,不是笼统 Full-ish

更精确的说法(见 DeepSeek V4 架构说明):

  • CSA(Compressed Sparse Attention):压缩表示上的稀疏选择
  • HCA(Heavily Compressed Attention):重度压缩后不再做 sparse selection——不是「原序列上的 Full-ish attention」

「Sparse + Compress 极致」可作一句总结,但两类层的分工不同。苏文将 DSV4 读成「把 MLA 的 decode 形态推到极致再靠压缩/稀疏压成本」——这是高层次谱系读法,有助于和 K3 的 Linear+Full 对照;细节以官方层类型为准。

NoPE:官方结论短,几何延伸是我的

K3 的 MLA 去掉 RoPE。关键事实:

  • 全 MLA 设定下去 RoPE 通常伤效果(K2 脉络)
  • KDA+MLA 混合下,加回 RoPE 几乎无增益 → 最简原则去掉

K3 报告 支持的较弱结论:KDA 提供 position-sensitive、recency-aware 的顺序混合,故周期性 MLA 层可以用 NoPE。

苏文进一步借助 PaTH / Householder / DeltaNet 讨论广义位置结构——有启发。
我的额外一步(hypothesis,非官方):把它理解为「位置职责可部分外包给 linear 支路的动力学」,并延伸到 connection 的语言。证据到 KDA 的顺序混合为止;再往后是坐标系延伸,不是报告原句。

两条长上下文路线(对照用)

路线代表策略(粗)
压缩 + 稀疏交错V4:CSA / HCA压 KV 与算力,层类型分工
Linear + Full 混合K3:KDA + MLAlinear 扛效率与顺序混合,MLA 扛表达

谁更远,开放问题。并排是为了读下一份 tech report 时有坐标,不是押注。


6. 在这套读法下对齐的,和仍是配方的

对齐的现象(读法层,不是 lab 联署):

  • 无界或过猛的激活会破坏稳定训练
  • 离散专家选择带来真不连续结构(是否被官方列为首要靶点是另一回事)
  • 跨层 / 块间传输需要稳定补丁
  • Attention 是多目标约束,不是单点「最新模块更好」
  • 架构补丁多半是脚手架;数据与表示是否先天平滑,仍是另一层问题(V4 文 的 Max Ma 论点,仍作开放天花板)

配方分叉:

  • 边界:hard clamp vs softcap(kink/饱和 vs 光滑软帽)
  • 稳定:mHC 的 residual mixing 双随机约束 vs Latent 升维前 RMSNorm
  • 路由:时序一致决策 vs latent 扩展 + 分位均衡
  • 长上下文:CSA/HCA vs KDA+MLA

Frontier 实验室是否「先承认网络是几何对象再上约束」——这是我的归纳,不是已证实的集体共识。 能说的是:Muon、mHC、SiTU、QB、Anticipatory Routing 名字不同,都在给难训的离散/深层系统加约束;并排放进同一坐标系有用。

苏文方法论仍值得记:最小改动、一次少加变量、每处有消融。这和「可测诊断 + 最小脚手架」遵循同一种工程纪律,不依赖几何词表。

mHC 一句收窄

严格成立的是:mHC 把 residual-stream mixing 矩阵约束在双随机集合上,故该混合谱范数 ≤ 1(非膨胀)。完整层仍是

Hresx+HpostF(Hprex)H_{\mathrm{res}} x + H_{\mathrm{post}}^\top F(H_{\mathrm{pre}} x)

非线性分支 FF 不会因此自动变成整层 Lipschitz-1。对照表里应写「约束纯 residual transport 非膨胀」,而不是「层间扰动不可能放大」。


7. 还没量、但该量的

  1. Softcap vs hard clip:比饱和、边界梯度/曲率,不要用 hardG 找函数跳变。
  2. LatentMoE 上的 M1/M2/M3:降维路由与更大专家池后,cliff 与边界占比如何变;升维前 Norm on/off 对块输出尺度与跳变的影响。
  3. 开放权重谱系:能拿到的 hybrid / compressed-attention 权重,是否支持「两条路线」的粗图像。

有数之前,几何读法是坐标系,不是判决书。


8. 收束

K3 与 DeepSeek V4 不必互相消灭。

  • V4 把训练稳定性推成一组几乎可命名的工程防线。
  • K3 把 MoE 可扩展性 + Attention 多目标取舍 写成不炫技、可消融的增量。

并排放:不是两份互斥的「正确架构」,而是同一类工程压力下的两种脚手架——硬边界与软边界、时序路由与 latent 扩展、压缩稀疏交错与 Linear+Full 混合。

数据与表示是否先天平滑,两边都还没有终局答案。
两条长上下文路线谁更远,也还没有终局答案。

眼下更有用的,是带着这张作者提出的坐标系去读下一份 tech report:先问它压的是激活、路由还是跨层;再问补丁是硬约束还是软约束;最后才问 benchmark 数字。


依据分层:官方——Kimi K3 技术报告Kimi-K3 架构说明DeepSeek V4 文档mHC 论文;解读——苏剑林 《简单谈谈 K3 的 MoE 和 Attention》;坐标系——本站 DeepSeek V4 与流形撕裂训好的 MoE,撕裂有多严重?