Andrej Karpathy的RSS订阅清单

← Andrej Karpathy的RSS订阅清单New · 6 min

MoE作者:「均衡得太完美,模型反而学得更差」

MoE作者:「均衡得太完美,模型反而学得更差」New6 min

MoE 的难点不只是“让更多专家参与计算”,而是避免路由器在训练中悄悄偏向少数专家,让大量参数沦为闲置库存。Giles Thomas 基于 Raschka 的 GPT-2 实现,从零构建并训练 MoE,在单张 RTX 3090 上完整验证了路由可训练性、专家塌缩与负载均衡之间的关键关系。

本文最有价值的洞察是:负载均衡并非越强越好。当模型过度追求专家使用的绝对公平时,语言建模能力反而会受损。这是一篇兼具数学细节、工程实践与实验复盘的 MoE 入门与进阶读物。

原文链接:

https://www.gilesthomas.com/2026/09/gpt-2-to-moe

原文标题:Extending Raschka's GPT-2: an MoE trained from scratch on an RTX 3090

主要内容:

• MoE 以多个专家 FFN 替换 Transformer 中的单一 FFN,让每个 token 仅激活少数专家,在控制计算量的同时扩大模型容量。

• 路由器的 Top-k 选择本身不可导;通过对未选专家掩码并对选中专家的权重进行 softmax,梯度才能回传到路由器。

• 单专家路由会导致 softmax 权重恒为 1、梯度归零,因此至少激活两个专家,才能让路由器学习不同专家之间的相对偏好。

• 即使训练 loss 持续下降,路由也可能发生专家塌缩:绝大多数 token 被送往同一个专家,其余专家几乎得不到训练。

• 负载均衡损失能够缓解塌缩,但系数过大也会伤害主任务表现;实验显示,适度均衡优于“绝对公平”。

推荐理由: