机器学习算法分类
1 课程概览
本课详细讲解机器学习算法的四大分类:监督学习、无监督学习、半监督学习、强化学习。重点阐述各分类的特征与标签情况,并引出机器学习要解决的三大类问题(分类、回归、聚类),同时通过KNN算法的欧式距离计算示例进行铺垫。
2 核心概念与定义
- 监督学习(Supervised Learning):有特征有标签的学习方式。
- 无监督学习(Unsupervised Learning):有特征无标签的学习方式,根据样本间相似性进行聚类。
- 半监督学习(Semi-supervised Learning):有特征,部分有标签、部分无标签的学习方式。
- 强化学习(Reinforcement Learning):理论上属于深度学习,是机器学习的分支。
- 分类问题(Classification):标签不连续的监督学习问题,如二分类、多分类。
- 回归问题(Regression):标签连续的监督学习问题,如房价预测。
- 聚类问题(Clustering):无监督学习,根据样本间相似性分群。
- 欧式距离(Euclidean Distance):对应维度差值平方和开平方根。
3 算法与模型详解
3.1 机器学习算法四大分类
| 类别 | 特征 | 标签 | 说明 | 本阶段是否涉及 |
|---|---|---|---|---|
| 监督学习 | 有 | 有 | 有特征有标签 | ✅ |
| 无监督学习 | 有 | 无 | 有特征无标签,根据相似性聚类 | ✅ |
| 半监督学习 | 有 | 部分 | 部分有标签,部分无标签 | ✅ |
| 强化学习 | — | — | 属于深度学习范畴 | ❌(下阶段讲) |
3.2 监督学习的细分
根据标签是否连续,监督学习分为:
| 类型 | 标签特点 | 示例 | 算法 |
|---|---|---|---|
| 分类(Classification) | 不连续(离散) | 薪资低/中/高、好瓜/坏瓜 | KNN、逻辑回归、决策树 |
| 回归(Regression) | 连续 | 房价预测(面积越大价格越高) | 线性回归 |
一般标签多为不连续,即分类问题居多。
3.3 无监督学习——聚类
- 特点:有特征,无标签。
- 方法:根据样本间相似性进行聚类(人以类聚,物以群分)。
- 示例:根据着装、职业、性别等特征对人群进行分群。
- 典型算法:KMeans。
3.4 半监督学习
核心思想:降低专家标注成本。
流程:
- 专家抽取少量数据并打标签(真实标记)。
- 利用已标记数据训练模型。
- 用模型对未标记数据进行预测。
- 询问领域专家,对比模型预测结果与专家分类结果。
- 专家进行校验和审核。
案例:新冠病毒肺部CT诊断
- 医疗专家抽取部分CT片做标记(得/未得新冠)。
- 用标记数据训练模型。
- 模型对测试集CT片进行预测。
- 专家校验预测结果,大幅提升效率。
3.5 KNN算法与欧式距离(铺垫)
KNN核心思想:K个临近邻居投票决定类别。
欧式距离计算示例:
已知电影数据(搞笑镜头、拥抱镜头、打斗镜头数量),求唐人街探案与功夫熊猫的欧式距离:
| 电影 | 搞笑 | 拥抱 | 打斗 |
|---|---|---|---|
| 功夫熊猫 | 39 | 0 | 31 |
| 唐人街探案 | 23 | 3 | 17 |
$$d = \sqrt{(39-23)^2 + (0-3)^2 + (31-17)^2}$$ $$= \sqrt{16^2 + 3^2 + 14^2}$$ $$= \sqrt{256 + 9 + 196}$$ $$= \sqrt{461} \approx 21.47$$
KNN分类流程:
- 计算待预测样本与所有已知样本的距离。
- 选取距离最近的K个邻居(如K=5)。
- K个邻居投票决定类别(少数服从多数)。
3.6 四大距离度量方式
| 距离名称 | 别名 |
|---|---|
| 欧式距离(Euclidean Distance) | 默认使用 |
| 曼哈顿距离(Manhattan Distance) | 城市街区距离 |
| 切比雪夫距离(Chebyshev Distance) | — |
| 闵氏距离(Minkowski Distance) | — |
4 数学原理与推导
4.1 欧式距离公式
$$d = \sqrt{\sum_{i=1}^{n}(x_i - y_i)^2}$$
- $x_i$:样本x的第i个特征值
- $y_i$:样本y的第i个特征值
- $n$:特征维度数
4.2 计算示例
$$d = \sqrt{(39-23)^2 + (0-3)^2 + (31-17)^2} = \sqrt{256 + 9 + 196} = \sqrt{461} \approx 21.47$$
5 代码示例
本课无完整代码,KNN详细实现将在后续课程讲解。
6 重难点与易错提醒
- ❗重点:监督学习=有特征有标签;无监督学习=有特征无标签;半监督学习=部分有标签。
- ❗重点:机器学习要解决三大类问题:分类(标签不连续)、回归(标签连续)、聚类(无标签)。
- ⚠️易错:强化学习严格意义上属于深度学习,但深度学习是机器学习的分支,所以也归入机器学习算法分类。
- ⚠️易错:标签连续→回归;标签不连续→分类。不要混淆。
- 💡深入理解:半监督学习的核心价值在于降低专家标注成本,通过模型预测+专家校验提升效率。
7 课堂问答精选
Q: 机器学习要解决哪三大类问题?
A:
- 分类问题:监督学习,标签不连续(如二分类、多分类)。
- 回归问题:监督学习,标签连续(如房价预测)。
- 聚类问题:无监督学习,无标签,根据样本间相似性分群。
Q: 半监督学习有什么好处?
A: 大幅降低专家标注成本。专家只需标注少量数据,训练模型后由模型预测,再由专家校验,效率大幅提升。
8 本课小结
- 机器学习算法分四类:监督、无监督、半监督、强化学习。
- 监督学习细分为分类(标签不连续)和回归(标签连续)。
- 无监督学习即聚类,根据样本间相似性分群。
- 半监督学习可降低专家标注成本。
- KNN核心:计算距离→选K个邻居→投票决定类别。
- 欧式距离:对应维度差值平方和开平方根。
9 延伸思考与实践
- 思考:如何根据业务场景选择合适的机器学习算法?
- 思考:半监督学习在医疗诊断中如何应用?
- 预习:KNN算法的详细实现与四大距离度量方式。