Transformer 全景:一张图看懂架构
自顶向下拆解 Transformer 的整体结构:输入嵌入、注意力层、前馈网络与残差连接,建立完整的架构心智模型。
先记住一句话
Transformer = 输入嵌入 + N 层相同结构的块(注意力 + 前馈网络)+ 输出头。所有大模型,无论叫 GPT 还是 GLM,内核都是这个结构的变体。
数据流全景
"你好世界"
↓ Tokenizer 切词 → [你, 好, 世, 界]
↓ 词嵌入(Embedding) → 4 个向量
↓ + 位置编码 → 让模型知道词序
│
↓ ┌── Transformer Block × N ──┐
↓ │ 自注意力层(词与词交换信息)│
↓ │ 前馈网络 FFN(逐向量加工) │
↓ │ 残差连接 + 层归一化 ×2 │
↓ └───────────────────────────┘
↓ 输出头(Linear + Softmax)→ 下一个词的概率分布
三个保持训练稳定的"工程三件套"
- 残差连接(Residual):每个子层的输出 = 子层(输入) + 输入,梯度可以"抄近道"直通底层,几十上百层也能训得动;
- 层归一化(LayerNorm):把每层输出拉回稳定分布,防止数值爆炸;
- 缩放点积:注意力分数除以 √d,防止 softmax 饱和。
为什么这个架构能"变大"
- 注意力层天然并行(不像 RNN 要逐词算),GPU 利用率高;
- 结构高度统一,堆层数、加参数就能稳定涨点 —— "规模化定律"的物理基础。
后续课程将逐个放大这些组件:自注意力的 Q/K/V、多头机制、位置编码,以及它们在推理时的优化。
📝 课后练习
quiz-1 Transformer 中残差连接(Residual Connection)的作用是?