Transformer 架构 中级

Transformer 全景:一张图看懂架构

自顶向下拆解 Transformer 的整体结构:输入嵌入、注意力层、前馈网络与残差连接,建立完整的架构心智模型。

先记住一句话

Transformer = 输入嵌入 + N 层相同结构的块(注意力 + 前馈网络)+ 输出头。所有大模型,无论叫 GPT 还是 GLM,内核都是这个结构的变体。

数据流全景

"你好世界"
↓ Tokenizer 切词        → [你, 好, 世, 界]
↓ 词嵌入(Embedding)      → 4 个向量
↓ + 位置编码             → 让模型知道词序
│
↓ ┌── Transformer Block × N ──┐
↓ │   自注意力层(词与词交换信息)│
↓ │   前馈网络 FFN(逐向量加工)  │
↓ │   残差连接 + 层归一化 ×2     │
↓ └───────────────────────────┘
↓ 输出头(Linear + Softmax)→ 下一个词的概率分布

三个保持训练稳定的"工程三件套"

  • 残差连接(Residual):每个子层的输出 = 子层(输入) + 输入,梯度可以"抄近道"直通底层,几十上百层也能训得动;
  • 层归一化(LayerNorm):把每层输出拉回稳定分布,防止数值爆炸;
  • 缩放点积:注意力分数除以 √d,防止 softmax 饱和。

为什么这个架构能"变大"

  • 注意力层天然并行(不像 RNN 要逐词算),GPU 利用率高;
  • 结构高度统一,堆层数、加参数就能稳定涨点 —— "规模化定律"的物理基础。
后续课程将逐个放大这些组件:自注意力的 Q/K/V、多头机制、位置编码,以及它们在推理时的优化。

📝 课后练习

quiz-1 Transformer 中残差连接(Residual Connection)的作用是?