机器学习相关概述目录介绍
1 课程概览
本课介绍机器学习相关概述的八大内容模块,包括AI/ML/DL三大概念、应用领域与发展史、核心术语(样本、特征、标签、训练集、测试集)、机器学习定义、算法分类、建模流程、特征工程子领域、模型拟合问题及开发环境搭建。重点强调核心术语的记忆与理解。
2 核心概念与定义
- 人工智能(Artificial Intelligence, AI):用计算机模拟人脑,让计算机像人类一样理性思考和行动。
- 机器学习(Machine Learning, ML):用机器模拟人脑,让计算机自动学习而非人为编程。
- 深度学习(Deep Learning, DL):大脑仿生设计,一层层神经元模拟万事万物。
- 样本(Sample):一条数据称为一个样本。
- 特征(Feature):分析的字段称为特征。
- 标签(Label):需要预测的结果字段称为标签。
- 训练集(Training Set):给模型训练使用的数据。
- 测试集(Test Set):用于测试模型结果的数据。
- 训练集与测试集占比:一般为7:3或8:2,7:3居多。
- 欠拟合(Underfitting):学到的东西太少,模型太简单。
- 过拟合(Overfitting):学到的东西太多,模型太复杂。
- 正好拟合(Good Fit):模型复杂度适中,泛化能力好。
3 算法与模型详解
3.1 机器学习算法分类
| 类别 | 特征 | 标签 | 说明 |
|---|---|---|---|
| 监督学习(Supervised Learning) | 有 | 有 | 有特征有标签 |
| 无监督学习(Unsupervised Learning) | 有 | 无 | 有特征无标签 |
| 半监督学习(Semi-supervised Learning) | 有 | 部分 | 部分内容打标记,基于标记数据训练 |
| 强化学习(Reinforcement Learning) | — | — | 严格意义上属于深度学习,是机器学习的分支 |
3.2 机器学习建模流程(六步)
- 数据加载
- 数据预处理
- 特征工程
- 模型训练
- 模型评估
- 模型预测
注:第5步与第6步顺序可能互换,有时先预测再评估。
3.3 特征工程的五个子领域
- 特征提取(Feature Extraction)
- 特征预处理(Feature Preprocessing)
- 特征降维(Dimensionality Reduction)
- 特征选择(Feature Selection)
- 特征组合(Feature Combination)
3.4 模型拟合问题
- 欠拟合:模型学到的东西太少,模型过于简单。
- 过拟合:模型学到的东西太多,模型过于复杂。
- 目标:达到正好拟合。
4 数学原理与推导
本课无数学推导。
5 代码示例
环境搭建命令(Python):
# 安装scikit-learn机器学习库
pip install scikit-learn
6 重难点与易错提醒
- ❗重点:核心术语(样本、特征、标签、训练集、测试集)必须熟记,后续天天使用。
- ❗重点:人工智能之父——约翰·麦卡锡(John McCarthy);机器学习之父——亚瑟·塞缪尔(Arthur Samuel)。
- ❗重点:人工智能元年为1956年(达特茅斯会议)。
- ⚠️易错:训练集与测试集占比一般为7:3或8:2,7:3居多。
- ⚠️易错:强化学习严格意义上属于深度学习,但深度学习可理解为机器学习的分支。
- 💡深入理解:特征工程的五个子领域(提取、预处理、降维、选择、组合)是今天稍绕的概念,需重点区分。
7 课堂问答精选
Q: 机器学习建模流程中,模型评估和模型预测的顺序是固定的吗?
A: 不固定。一般是先评估再预测,但有些场景会先预测再评估,两者顺序可能互换。
8 本课小结
- AI/ML/DL为包含关系:人工智能包含机器学习,机器学习包含深度学习。
- 核心术语:样本(一条数据)、特征(分析字段)、标签(结果字段)、训练集(训练用)、测试集(测试用)。
- 机器学习算法分四类:监督、无监督、半监督、强化学习。
- 建模六步流程:加载→预处理→特征工程→训练→评估→预测。
- 模型拟合三态:欠拟合、过拟合、正好拟合(目标)。
9 延伸思考与实践
- 思考:人工智能、机器学习、深度学习三者的关系如何理解?
- 记忆:人工智能之父(约翰·麦卡锡)、机器学习之父(亚瑟·塞缪尔)、人工智能元年(1956年)。
- 实践:完成scikit-learn库的安装,为后续实操做准备。