🎯 课程主题
Transformer 算法的背景、起源及其对深度学习领域的深远影响。
📝 核心知识点
1. Transformer 的起源
- 概念说明:Transformer 由 Google 团队于 2017 年提出,是一个开创性的发明。
- 关键细节:
- 最初用于时间序列建模任务,在机器翻译中做实验验证
- 论文名为《Attention is All You Need》
- 后续大量深度学习工作基于该架构开展
2. 时间序列任务的特点
- 概念说明:自然语言具有时间顺序特性,是 Transformer 的主要应用场景。
- 关键细节:
- 自然语言有严格的顺序,打乱后语义难以理解
- 时间序列数据:$X_1, X_2, X_3, \ldots, X_N$ 具有时序依赖关系
3. 相比 RNN/LSTM 的核心改进
- 概念说明:Transformer 解决了早期循环神经网络的两大痛点。
- 关键细节:
- 并行性提升:RNN/LSTM 必须按时间步顺序计算($t_1 \to t_2 \to t_3 \ldots$),效率极低;Transformer 支持数据并行输入,大幅提高计算效率
- 长距离依赖建模能力:RNN/LSTM 对早期时间步信息容易遗忘(如 $X_1, X_2$ 的信息丢失);LSTM 虽有改进但仍未根本解决;Transformer 基于注意力机制有效缓解该问题
4. Transformer 的主要技术组成
- 概念说明:Transformer 综合运用了多种网络结构与技术。
- 关键细节:
- 结构:编码器(Encoder)+ 解码器(Decoder)
- 三种注意力机制:编码多头注意力、交叉注意力、解码多头注意力(本质都是多头注意力机制,仅有细微差别)
- 位置编码:为输入数据赋予时间序列信息
- 残差连接(来自 ResNet)、层归一化(Layer Normalization)、前馈神经网络
- 标准模型块可堆叠多层,实现深层稳定训练
5. 对后续模型的影响
- 概念说明:Transformer 架构催生了一系列现代大模型。
- 关键细节:
- NLP 领域:BERT、ChatGPT(OpenAI)、DeepSeek、Gemini(Google)、通义千问(阿里)、豆包等
- 视觉领域:ViT(Vision Transformer)用于图像分类
- 多模态大模型:支持文字、图像等多类型输入
🧮 核心公式与推导
无
🏗️ 模型架构与数据流向
本节为算法背景介绍,核心架构要点:
- 整体采用 Encoder-Decoder 结构
- 编码器与解码器均可堆叠 N 层($N \times$)
- 内部包含多头注意力机制、残差连接、层归一化、前馈神经网络等标准模块
- 通过位置编码注入时序信息
💻 代码实战
无(本节为背景介绍)
⚠️ 常见问题与避坑指南
- 三种注意力机制(编码多头、交叉、解码多头)本质相同,不要被名称吓到,差别在于输入来源与 Mask 方式
- Transformer 是"缓解"而非完全解决长距离依赖问题,表述需严谨
💡 个人总结与延伸
Transformer 的提出是深度学习领域的里程碑,它通过注意力机制突破了 RNN 的并行瓶颈与长距离依赖限制。当前几乎所有主流大语言模型(LLM)均基于该架构演进,包括 GPT 系列、DeepSeek 等,其影响已从 NLP 扩展到视觉(ViT)和多模态领域。