🎯 课程主题
自注意力机制(Self-Attention)先导——Transformer 中最核心的算法模块。
📝 核心知识点
1. 注意力机制的重要性
- 概念说明:Transformer 论文《Attention is All You Need》强调注意力机制是模型核心。
- 关键细节:
- 编码器和解码器中都使用多头注意力机制
- 编码器中的多头注意力是自注意力(Self-Attention)
- 解码器中的第一个多头注意力也是自注意力(带因果掩码)
- 交叉注意力本质与自注意力相同,只是输入来源不同
2. 三种注意力机制的本质
- 概念说明:Transformer 中有三种注意力机制,底层都是自注意力。
- 关键细节:
- 编码多头注意力(自注意力):Q、K、V 均来自编码器前一层的输出
- 解码多头注意力(自注意力,带 Mask):Q、K、V 均来自解码器前一层的输出
- 交叉注意力:Q 来自解码器,K、V 来自编码器输出
- 三者底层结构相同,差别仅在输入来源
3. 自注意力机制的地位
- 概念说明:掌握自注意力机制是理解 Transformer 的关键。
- 关键细节:
- 自注意力机制 + 位置编码 + 词嵌入 ≈ 掌握 Transformer 80% 内容
- 多头注意力机制底层就是自注意力机制
- 搞通自注意力机制,整个模型架构基本解决 60%
🧮 核心公式与推导
无(本节为先导,具体公式在后续章节展开)
🏗️ 模型架构与数据流向
💻 代码实战
无(本节为先导介绍)
⚠️ 常见问题与避坑指南
- 三种注意力机制本质相同,不要被名称迷惑
- 自注意力与交叉注意力的区别仅在输入来源,算法流程完全一致
💡 个人总结与延伸
自注意力机制是 Transformer 的灵魂,它允许模型在处理序列时同时关注所有位置的关系。理解自注意力是掌握 Transformer 的关键第一步,后续的多头注意力、交叉注意力都建立在此基础上。