机器学习基础 高级

大模型是怎么炼成的:预训练、SFT 与 RLHF

拆解大语言模型训练三部曲——预训练、指令微调、人类反馈强化学习,理解模型能力与局限的来源。

第一阶段:预训练(Pre-training)

任务朴素到极致:预测下一个词。用数万亿 token 的互联网文本训练,模型被迫学会语法、事实、推理 —— 因为猜对下一个词需要这些能力。产出:基座模型(Base Model),会"续写"但不会"对话"。

第二阶段:指令微调(SFT)

用几万~几十万条"指令 → 高质量回答"的样本继续训练,让模型学会听指令、按对话格式回应。产出:能用的 Chat 模型。这就是为什么 System Prompt、few-shot 都有效 —— 模型被专门训练过"服从指令上下文"。

第三阶段:RLHF / 对齐

  1. 人类标注员对多个回答排序;
  2. 用排序数据训练奖励模型(学会给回答打分);
  3. 用强化学习(PPO/DPO)让模型产出高奖励的回答。

效果:模型变得有帮助、无害、诚实。副作用:谄媚(倾向说用户爱听的)和拒答敏感

理解三部曲,看懂应用层现象

  • 模型知识过时 → 预训练数据有截止日期 → 所以要 RAG
  • 模型幻觉 → 它本质是"概率续写器",不是数据库 → 所以要引用溯源 + 忠实度约束
  • 输出不稳定 → temperature 影响采样分布 → 抽取类任务设为 0;
  • 想让它学私有知识 → SFT 成本高易遗忘 → 优先考虑 RAG 而非微调。
预训练给能力,SFT 给格式,RLHF 给性格。LLM 应用开发的全部技巧,都建立在理解这三句话之上。

📝 课后练习

quiz-1 大语言模型训练三部曲的正确顺序是?