机器学习基础 中级

NLP 基础:从词向量到 Transformer

梳理 NLP 表示方法的进化史:One-Hot → 词向量 → RNN → Attention → Transformer,理解大模型的来路。

核心难题:如何让机器理解文字

One-Hot 编码:每个词一个独热向量。问题是维度爆炸且"猫"和"狗"的距离和"猫"和"火箭"一样远 —— 毫无语义。

词向量(Word Embedding)

Word2Vec/GloVe 把词映射为稠密低维向量,语义相近的词向量相近,甚至存在 国王 - 男 + 女 ≈ 女王 这样的线性关系。这正是本站 RAG 课程中 Embedding 的思想源头

序列建模的挣扎:RNN

词有顺序,RNN 逐词读入并维护"记忆"。但它记不住长文本(长程依赖丢失),且必须逐词串行计算,训练慢。

Attention 与 Transformer(2017)

论文标题就是宣言:《Attention Is All You Need》。核心思想:每个词直接"看"句中所有词,按相关性分配注意力权重,一步到位建立全句关联。

  • 自注意力(Self-Attention):并行计算,训练飞快;
  • 位置编码:补上"词序"信息;
  • 可堆叠:层数越多、参数越多,能力越强 —— 为"大"模型铺平道路。

大模型 = Transformer + 海量数据 + 疯狂堆料

GPT 系列用 Transformer 的解码器堆出千亿参数,把"预测下一个词"做到极致,涌现出了推理、翻译、写代码等通用能力。理解 Transformer,就理解了 LangChain 里每一个 ChatModel 的内核。

📝 课后练习

quiz-1 Transformer 论文《Attention Is All You Need》的核心主张是?