MoE 混合专家 中级

MoE 混合专家:用稀疏激活突破参数瓶颈

理解 Mixture of Experts 的核心思想:门控按需激活部分专家,把"模型总参数量"与"单次计算量"解耦。

稠密模型的困境

传统 Transformer(如 GPT、LLaMA)是稠密模型:每个 token 都要经过全部参数。想变强只能堆参数,但计算成本与参数量同步暴涨 —— 671B 的稠密模型没人跑得起。

MoE 的解法:分科问诊

混合专家(Mixture of Experts)把 FFN 层替换成多个并行的"专家 FFN",外加一个门控网络(Router/Gating):每个 token 只被路由给少数最合适的专家(如 256 个专家选 8 个)。

             ┌─ 专家 1 (FFN) ─┐
token ─→ 门控 ─┼─ 专家 2 (FFN) ─┼→ 加权合并 → 输出
             └─ 专家 N (FFN) ─┘
      (只有得分 Top-K 的专家实际计算)

关键概念:总参数 ≠ 计算参数

  • 总参数量:所有专家加起来,决定模型的能力上限与显存占用;
  • 激活参数量:每个 token 实际用到的部分,决定单次推理的计算量与速度。

例:DeepSeek-V3 总参数 671B,但每 token 仅激活约 37B —— 获得超大模型的能力,付出中型模型的推理成本。这就是 MoE 火爆的原因。

用你熟悉的话理解

MoE 之于 Transformer,就像本站《意图识别》路由之于助手:不把问题丢给所有人,而是先判断"该谁处理"。区别在于 MoE 的路由在每一层、每个 token 上都发生一次。

代表模型

  • Mixtral 8x7B(开源 MoE 出圈之作,8 专家选 2);
  • DeepSeek-V3/R1、Qwen3-MoE、GLM 系列大杯(国产旗舰普遍采用 MoE);
  • GPT-4 被广泛推测也采用 MoE 架构(未官方证实)。

📝 课后练习

quiz-1 MoE(混合专家)架构最核心的思想是?