神经网络与深度学习入门
理解神经元、激活函数、反向传播的核心思想,以及为什么深度学习能统治 NLP。
神经元:加权求和 + 激活
输出 = 激活函数( w₁x₁ + w₂x₂ + … + b )
单层神经网络只能画直线;多层 + 非线性激活函数(ReLU 等)让它能拟合任意复杂函数 —— 这是深度学习能力的根源。
训练怎么发生
- 前向传播:输入经过网络得到预测;
- 损失函数:量化预测与答案的差距;
- 反向传播:用链式法则算出每个参数对损失的"责任"(梯度);
- 梯度下降:参数朝减小损失的方向挪一小步,重复千万次。
深度学习的"深度"指什么
指网络层数多。层层堆叠让网络能学到逐级抽象的特征:文本任务中,浅层学词法、中层学语法、深层学语义。代价是需要大数据、大算力,且可解释性差。
为什么 NLP 被深度学习统治
文本的特征(语义、上下文)无法人工设计,必须靠端到端学习。从 Word2Vec → RNN → Transformer,表示能力逐代跃迁,最终在 Transformer 上演化出了大语言模型 —— 下一课详解。
对 LLM 应用开发者:不需要会训神经网络,但理解"预训练 + 损失 + 梯度"这三个词,能帮你读懂 90% 的大模型技术文章。
📝 课后练习
quiz-1 神经网络中激活函数的作用是?