🎯 课程主题
Transformer 模型的整体架构解析,从输入到输出的完整数据流转过程。
📝 核心知识点
1. 架构设计理念
- 概念说明:Transformer 与经典网络模型(ResNet、VGG)类似,由基本模块重复堆叠构建。
- 关键细节:
- ResNet 有 ResNet-18/34/50 等变体,VGG 有 VGG-16 等,均通过模块复用堆叠
- Transformer 同样采用编码器(Encoder)和解码器(Decoder)各 $N$ 层堆叠
- 模块化设计便于理解与代码实现
2. 编码器(Encoder)数据流
- 概念说明:编码器负责对输入序列进行特征提取。
- 关键细节(以英译中 "I love you" → "我爱你" 为例):
- 输入文本 → 转换为词嵌入向量(Embedding)
- 加上位置编码(Positional Encoding)→ 注入时序信息
- 多头注意力机制(Multi-Head Attention)
- 残差连接 + 层归一化(Add & Norm)
- 前馈神经网络(Feed Forward)
- 残差连接 + 层归一化(Add & Norm)
- 编码器输入是一股脑全部输入(并行)
3. 解码器(Decoder)数据流
- 概念说明:解码器采用自回归方式逐步生成输出。
- 关键细节:
- 输入包含起始符(如
<S>)、已生成的词、结束符(如<E>) - 生成过程:
<S>→ "我" → "爱" → "你" →<E> - 每一步基于前面已生成的内容预测下一个词
- 类似 GPT 大模型的逐字输出机制
- 解码器内含:
- 带因果掩码的多头注意力(Masked Multi-Head Attention)
- 交叉注意力(Cross Attention):Q 来自解码器,K/V 来自编码器输出
- 前馈神经网络 + 残差连接 + 层归一化
- 输入包含起始符(如
4. 输出层
- 概念说明:最终通过全连接层 + Softmax 输出词表概率分布。
- 关键细节:
- 全连接层将特征映射到词表大小 $V$
- Softmax 输出每个词的概率
- 取概率最大的词作为输出(如 "我" 概率 0.95 → 输出 "我")
- 本质上是一个分类任务
🧮 核心公式与推导
无(本节为架构概览,具体公式在后续章节展开)
🏗️ 模型架构与数据流向
关键维度说明:
- 编码器:并行输入全部 token
- 解码器:自回归逐 token 生成
- 交叉注意力连接编码器与解码器
💻 代码实战
无(本节为架构概览,代码在第三章详细展开)
⚠️ 常见问题与避坑指南
- 编码器输入是并行全部输入,解码器输出是自回归逐步生成,二者机制不同
- 因果掩码(Causal Mask)是解码器的重点与难点,防止未来信息泄露
- 交叉注意力中 Q 来自解码器、K/V 来自编码器,不要搞反
💡 个人总结与延伸
Transformer 采用经典的 Encoder-Decoder 架构,通过模块化堆叠实现深层网络。其解码器的自回归生成机制是当前所有生成式大模型(GPT 系列)的基础。理解整体数据流向是后续深入学习各组件(注意力、位置编码、Mask 等)的前提。