主流 MoE 模型盘点与选型指南
纵览 Mixtral、DeepSeek、Qwen、GLM 等主流 MoE 模型的设计差异,学会用"总参数/激活参数/专家数"三要素读懂模型卡片。
读懂 MoE 模型卡片的三个数字
- 总参数量:能力上限的参考(越大通常越强);
- 激活参数量:决定推理速度与 API 成本;
- 专家数 / Top-K:路由粒度(如 Mixtral 8 选 2,DeepSeek-V3 256 细粒度专家选 8)。
代表性模型速览
- Mixtral 8x7B:开源 MoE 普及者;8 专家选 2,总 ~47B / 激活 ~13B —— MoE 经济学的教科书案例;
- DeepSeek-V3 / R1:671B 总参 / ~37B 激活,细粒度专家 + 共享专家 + 无辅助损失路由,开源 MoE 的高峰;R1 系列叠加推理强化;
- Qwen3-MoE 系列:阿里开源 MoE,多尺寸覆盖,生态工具链完善;
- GLM 系列:智谱旗舰普遍采用 MoE 路线(如 GLM-4.5 等),中文能力强、API 价格友好;
- Switch Transformer:学术里程碑(Top-1 路由 + 万亿参数实验),理解 MoE 原理的最佳起点。
选型三问
- 部署在哪?本地小显存 → 激活参数小、总量适中的型号或稠密小模型;云端 API → MoE 旗舰通常性价比最优;
- 在意什么?吞吐/成本看激活参数;能力上限看总参数与训练数据;
- 任务类型?多领域混杂任务 MoE 受益明显(不同专家擅长不同域);窄域任务稠密小模型可能足够。
与站内知识的连接
- MoE 的路由思想 ↔《意图识别》《OpenClaw 工具路由》:都是"先分诊,再处理";
- MoE 的稀疏激活 ↔ 稠密模型的推理成本:呼应《Tokens、上下文窗口与成本》与《推理加速》课。
一句话总结:MoE 把"更多参数"和"更多计算"解绑了——这是 2024 年以来开源模型追平闭源的最大功臣。
📝 课后练习
quiz-1 选择 MoE 模型部署到本地时,应优先关注哪个指标来判断推理速度?