BERT 模型总结
1 课程概览
本课总结 BERT 模型。介绍 GLUE(英文基准数据集)和 CLUE(中文基准数据集),它们是全球公认的 NLP 评测平台。如果模型在这些数据集上表现好,说明模型成功。CLUE 支持中文任务,可以从官网下载数据集和评测。
2 核心概念与定义
- GLUE:General Language Understanding Evaluation,英文基准数据集。
- CLUE:Chinese Language Understanding Evaluation,中文基准数据集。
- 公共数据集:全球公认的数据集。
- 11 个子任务:GLUE 的标准任务。
3 模型与算法详解
GLUE 基准
英文基准数据集,全球公认。
- 创建者:纽约大学、华盛顿大学等机构
- 包含 11 个子任务
- 衡量 NLP 研究发展的标准
- 数据集都是英文
GLUE 的 11 个子任务
NLP 任务的标准。
| 任务 | 说明 |
|---|---|
| 文本分类 | 情感分类 |
| 特征抽取 | 特征提取 |
| 阅读理解 | 问答系统 |
| 文本摘要 | 文本摘要 |
| NER | 命名实体识别 |
| 完形填空 | 掩码预测 |
| ... | 其他任务 |
CLUE 基准
中文基准数据集,服务中文语言。
- 官网:GitHub
- 支持中文任务
- 可以下载数据集
- 可以立即评测
如何使用 GLUE/CLUE
测试模型的标准流程。
1. 从 GLUE/CLUE 上下载数据集
2. 用模型在数据集上训练和测试
3. 将预测结果上传到官方网站
4. 官方审核后给出确认结果
5. 在简历上写明成绩
找工作时的应用
在简历上写明 GLUE/CLUE 成绩。
- "我之前自研的模型,在 GLUE 基准数据集上测试,准确率达到 XX%"
- 比写项目经历更有说服力
CLUE 数据集来源
多家公司提供。
- QQ 浏览器
- 蚂蚁金融
- ZeroCLUE(零样本学习)
- ...
4 数学原理与推导
准确率
$$\text{accuracy} = \frac{\text{correct}}{\text{total}}$$
GLUE 评分
$$\text{GLUE_score} = \frac{1}{N} \sum_{i=1}^{N} \text{accuracy}_i$$
其中:
- $N$ 是任务数量
- $\text{accuracy}_i$ 是第 $i$ 个任务的准确率
5 代码示例
# === GLUE 任务示例 ===
print("=== GLUE 任务 ===")
print("1. 文本分类")
print("2. 特征抽取")
print("3. 阅读理解")
print("4. 文本摘要")
print("5. NER")
print("6. 完形填空")
print("...")
# === CLUE 数据集下载 ===
print("\n=== CLUE 数据集 ===")
print("官网: https://github.com/CLUEbenchmark/CLUE")
print("支持任务:")
print(" - 文本分类")
print(" - 阅读理解")
print(" - NER")
print(" - ...")
# === 评测流程 ===
print("\n=== 评测流程 ===")
print("1. 下载数据集")
print("2. 训练模型")
print("3. 预测结果")
print("4. 上传结果")
print("5. 获得确认")
6 重难点与易错提醒
- ❗重点:GLUE 是英文基准数据集,CLUE 是中文基准数据集。
- ❗重点:GLUE 包含 11 个子任务,是衡量 NLP 研究发展的标准。
- ❗重点:模型在 GLUE/CLUE 上表现好,说明模型成功。
- ❗重点:找工作时可以写 GLUE/CLUE 成绩。
- 💡技巧:CLUE 可以从官网下载数据集和评测。
7 课堂问答精选
Q1:GLUE 是什么?
A:GLUE(General Language Understanding Evaluation)是英文基准数据集,由纽约大学、华盛顿大学等机构共同创建,包含 11 个子任务,是衡量 NLP 研究发展的标准。
Q2:CLUE 是什么?
A:CLUE(Chinese Language Understanding Evaluation)是中文基准数据集,服务中文语言,可以从官网下载数据集和评测。
Q3:如何使用 GLUE/CLUE?
A:从 GLUE/CLUE 上下载数据集,用模型在数据集上训练和测试,将预测结果上传到官方网站,官方审核后给出确认结果。
Q4:找工作时如何应用?
A:在简历上写明:"我之前自研的模型,在 GLUE/CLUE 基准数据集上测试,准确率达到 XX%",比写项目经历更有说服力。
8 本课小结
- GLUE 是英文基准数据集,CLUE 是中文基准数据集。
- GLUE 包含 11 个子任务,是衡量 NLP 研究发展的标准。
- 模型在 GLUE/CLUE 上表现好,说明模型成功。
- 找工作时可以写 GLUE/CLUE 成绩。
9 延伸思考
- GPT 和 BERT 有什么区别?
- 三大模型(BERT、ELMo、GPT)的优缺点是什么?