Transformer 框架 - 由来介绍
1 课程概览
本课介绍 Transformer 的诞生背景。2017 年 Google 团队发表论文《Attention is All You Need》提出 Transformer 架构。2018 年 BERT 模型横扫 NLP 领域 11 项任务最佳成绩,底层用 Transformer 实现。现在的大模型(如 ChatGPT)底层都有注意力机制。
2 核心概念与定义
- Transformer:2017 年提出的革命性模型架构。
- Attention is All You Need:Transformer 的原始论文。
- BERT:2018 年 Google 发表的模型,底层用 Transformer。
- ChatGPT:OpenAI 的大模型,GPT 的 T 指 Transformer。
- 注意力机制:Transformer 的底层技术。
3 模型与算法详解
Transformer 诞生时间线
| 时间 | 事件 |
|---|---|
| 2017 年 | Google 发表论文《Attention is All You Need》 |
| 2017 年 | 没火(只有理论,没有落地项目) |
| 2018 年 | Google 发表 BERT,横扫 NLP 11 项任务最佳成绩 |
| 2019 年至今 | 大模型(ChatGPT 等)底层都有注意力机制 |
以前模型的弊端
在没有 Transformer 之前,NLP 用的是 RNN、LSTM、GRU。
| 弊端 | 说明 |
|---|---|
| 长文本效果差 | 一个一个传,没有注意力侧重点 |
| 梯度消失/爆炸 | 可能出现梯度问题 |
Transformer 的优势
- 注意力机制最早用于机器翻译
- 解决长文本问题
- 避免梯度消失/爆炸
BERT 和 GPT
| 模型 | 公司 | 底层 | 特点 |
|---|---|---|---|
| BERT | Transformer | 双向 | |
| GPT | OpenAI | Transformer | 单向 |
| ChatGPT | OpenAI | Transformer | 大模型 |
迁移学习
预训练语言模型,别人用的时候直接加载就可以用。
- 自己训练好的模型
- 别人直接加载使用
- 后续课程会讲如何做迁移学习
4 数学原理与推导
本课为背景介绍,无数学原理。
5 代码示例
本课为背景介绍,无代码示例。
6 重难点与易错提醒
- ❗重点:Transformer 2017 年提出,2018 年 BERT 横扫 NLP。
- ❗重点:ChatGPT 的 T 指 Transformer。
- ⚠️易错:2017 年没火,2018 年 BERT 出来才火。
- 💡深入理解:注意力机制最早用于机器翻译。
- 💡深入理解:现在的大模型底层都有注意力机制。
7 课堂问答精选
Q1:Transformer 是什么时候提出的?
A:2017 年,Google 团队发表论文《Attention is All You Need》提出 Transformer 架构。
Q2:为什么 2017 年没火?
A:因为只有理论,没有落地的项目或框架。2018 年 BERT 出来,横扫 NLP 11 项任务最佳成绩,大家才发现注意力机制这么强大。
Q3:ChatGPT 和 Transformer 有什么关系?
A:ChatGPT 的 GPT 的 T 指 Transformer。ChatGPT 底层是用 Transformer 来实现的。
Q4:以前的 NLP 模型有什么弊端?
A:以前用 RNN、LSTM、GRU,弊端是:①处理长文本效果差(一个一个传,没有注意力侧重点);②可能出现梯度消失和梯度爆炸。
8 本课小结
- 2017 年:Google 发表《Attention is All You Need》。
- 2018 年:BERT 横扫 NLP 11 项任务最佳成绩。
- ChatGPT 的 T 指 Transformer。
- 以前模型弊端:长文本效果差、梯度问题。
- 现在大模型底层都有注意力机制。
9 延伸思考
- Transformer 架构由哪几部分组成?
- 注意力机制如何解决长文本问题?