NLP 发展简史介绍
1 课程概览
本课介绍自然语言处理(NLP)的基本概念、发展简史及应用领域。从 NLP 的定义出发,阐述其作为计算机科学、人工智能和语言学交叉学科的定位,并回顾从 1950 年图灵测试到现代大模型的技术演进脉络。
2 核心概念与定义
- NLP(Natural Language Processing,自然语言处理):计算机科学、人工智能和语言学的交叉学科,旨在让计算机理解和生成人类语言。
- 图灵测试(Turing Test):1950 年计算机科学之父图灵(Alan Mathison Turing)在论文《计算机器与智能》中提出的测试,用于判断机器是否具备智能。
- jieba 分词:中文分词工具,支持精确模式、全模式、搜索引擎模式三种分词方式。
- 注意力机制(Attention Mechanism):大模型底层核心技术之一。
3 模型与算法详解
NLP 的核心目标
NLP 的目的在于让计算机能够理解和生成人类的语言,这包含两个关键环节:
- 理解输入:计算机能理解用户输入的内容(语义理解)
- 若不理解词意,生成结果可能出现"驴唇不对马嘴"的情况
- 生成输出:计算机生成的内容人类能看懂,且符合人类语言习惯
- 不仅要有正确语义,还要符合语序和用语习惯
NLP 应用领域
| 应用领域 | 说明 |
|---|---|
| 语音识别 | 将语音转换为文本 |
| 语音合成 | 将文本转换为语音 |
| 自然语言理解 | 让计算机理解人类语义 |
| 机器翻译 | 不同语言之间的自动翻译 |
| 文本分类 | 对文本进行类别划分 |
| 情感分析 | 分析文本的情感倾向 |
自然语言理解的应用场景
- 问答系统
- 智能客服
- 搜索引擎
- 智能家居
大模型与切词
- 大模型无法直接处理一篇文章或超长句子
- 需要先进行切词(分词)处理
- 常用工具:jieba 分词(三种模式:精确模式、全模式、搜索引擎模式)
NLP 发展简史
- 1950 年:图灵在论文中提出"机器可以思考吗"(Can machines think?),即经典的图灵测试
- 图灵测试流程:
- 测试者写下自己的问题
- 以纯文本形式(通过计算机屏幕或键盘)发送
- 接收方为另一个房间中的人和机器
- 若测试者无法分辨对方是人还是机器,则机器通过测试
4 数学原理与推导
本课为概念介绍,无数学推导。
5 代码示例
本课为概念介绍,无代码示例。
6 重难点与易错提醒
- ❗重点:NLP 的两大核心环节——理解输入与生成输出,缺一不可。
- ⚠️易错:大模型生成的内容不仅要语义正确,还必须符合人类语言习惯(如语序正确)。
- 💡深入理解:大模型之所以火爆,底层核心是注意力机制和 Transformer 架构,而 NLP 是其基石。
- 💡深入理解:大模型无法直接处理超长文本,必须先切词,这是文本预处理的第一步。
7 课堂问答精选
Q1:为什么大模型现在这么火?
A:核心原因有两个——①大模型能理解用户输入的内容;②大模型生成的答案人类能看懂且符合人类语言习惯。这两点正是 NLP 技术的目标,NLP 是大模型的底层基石。
Q2:大模型能否直接处理一篇文章?
A:不能。大模型无法直接处理一篇文章或超长句子,需要先进行切词(分词)处理,常用工具是 jieba 分词。
8 本课小结
- NLP 是让计算机理解和生成人类语言的交叉学科。
- NLP 两大核心环节:理解输入 + 生成符合人类习惯的输出。
- 1950 年图灵提出图灵测试,是 NLP 发展的起点。
- 大模型处理文本前必须先切词,jieba 分词支持三种模式。
9 延伸思考
- 从图灵测试到现代大模型,NLP 技术经历了哪些关键突破?
- 注意力机制如何使大模型实现"理解"和"生成"?