MoE 的训练与推理:显存换算力的经济学
MoE 推理快在哪、贵在哪:激活参数决定 FLOPs,总参数决定显存;训练侧的不稳定与并行策略。
推理经济学的核心公式
- 计算量(FLOPs)∝ 激活参数量:每 token 只过 Top-K 专家,速度快、电费省;
- 显存占用 ∝ 总参数量:所有专家都得常驻显存待命。
结论:MoE 是"用显存换算力"的架构。DeepSeek-V3 要 671B 全量装进显存(量化后仍需数百 GB),但吞吐接近 37B 稠密模型。因此 API 便宜 ≠ 本地白嫖:本地部署 MoE 对显存要求反而高于同能力稠密模型。
推理侧的其他特点
- 显存带宽常是瓶颈:每 token 都要从显存读专家权重,批量越大越能摊薄;
- 批处理友好度下降:不同 token 路由到不同专家,专家权重的访问模式分散;
- KV Cache 与 MoE 无关:注意力部分与稠密模型相同 —— 这也是为什么"上下文窗口"话题对两者一致。
训练侧的挑战
- 路由不稳定:早期训练路由抖动剧烈,负载均衡损失系数要仔细调;
- 专家并行(EP):专家分布在不同 GPU 上,token 需要 all-to-all 通信 —— 大规模 MoE 训练的网络开销主要来源;
- 微调门槛:MoE 模型全量微调成本高,LoRA 通常只挂在注意力层或共享专家上。
对应用开发者的实际影响
- API 选型:MoE 旗舰(DeepSeek-V3、GLM 大杯)通常单价更低、速度更快,能力还强 —— 应用层直接受益;
- 本地部署:量力而行,先看激活参数对应的推理速度,再看总参数对应的显存需求;
- 延迟敏感场景:MoE 的"每 token 路由"开销极小(一个线性层),不构成瓶颈。
📝 课后练习
quiz-1 MoE 模型推理的"经济学"特点是?