基于规则和模型的学习介绍
1 课程概览
本课通过房价预测案例详细讲解基于模型的学习方式,重点介绍样本、特征、标签、训练集、测试集等核心术语的含义与相互关系,并引出线性回归的基本概念,说明机器学习中"权重"和"偏置"的命名约定。
2 核心概念与定义
- 基于规则的学习(Rule-based Learning):程序员根据经验,手工编写if-else规则进行判断。
- 基于模型的学习(Model-based Learning):从数据中自动学习规律,机器学习属于此类。
- 样本(Sample):每一行数据称为一个样本。
- 特征(Feature):用于分析的字段,即X轴数据,记为
x_train(训练集特征)或x_test(测试集特征)。 - 标签(Label):需要预测的结果字段,即Y轴数据,记为
y_train(训练集标签)或y_test(测试集标签)。 - 训练集(Training Set):已知的数据,包含
x_train和y_train。 - 测试集(Test Set):用于测试的数据,
x_test已知,y_test需要模型预测。 - 线性回归(Linear Regression):利用线性关系模拟变量之间关系的方法。
- 权重(Weight, W):线性回归中对应斜率的参数,机器学习中称为权重。
- 偏置(Bias, B):线性回归中对应截距的参数,机器学习中称为偏置。
3 算法与模型详解
3.1 两种学习方式对比
| 比较维度 | 基于规则的学习 | 基于模型的学习 |
|---|---|---|
| 实现方式 | 程序员手写if-else | 机器从数据中自动学习 |
| 典型案例 | 判断垃圾邮件(检查正文二维码、银行卡号等) | 房价预测 |
| 本质 | 人为编程 | 自动找规律、找公式 |
机器学习属于基于模型的学习。
3.2 房价预测案例——核心术语图解
以面积(X轴)与销售价格(Y轴)数据为例:
| 数据角色 | 说明 | 符号 |
|---|---|---|
| 训练集特征 | 已知的面积数据 | x_train |
| 训练集标签 | 已知的房价数据 | y_train |
| 测试集特征 | 待预测的面积(如109) | x_test |
| 测试集标签 | 待预测的房价(模型输出) | y_test |
❗模型的核心任务:已知
x_train、y_train、x_test,计算y_test。
3.3 线性回归基础
- 拟合回归线:基于坐标点绘制一条直线,使其尽可能穿过更多点,不能穿过的点尽量分布在直线两侧。
- 预测:根据拟合回归线,找到给定面积对应的房价。
- 公式:
$$y = kx + b$$
其中:
- $k$:斜率(Slope)
- $b$:截距(Intercept)
3.4 机器学习中的命名约定
在机器学习中,线性回归公式的参数命名有所变化:
$$y = Wx + B$$
| 数学名称 | 机器学习名称 | 符号 | 含义 |
|---|---|---|---|
| 斜率(Slope) | 权重(Weight) | $W$ | 特征对结果的影响程度 |
| 截距(Intercept) | 偏置(Bias) | $B$ | 基础偏移量 |
⚠️注意:Bias 的正确拼写是 "Bias",不是 "BIOS"。
4 数学原理与推导
4.1 一元线性回归公式
$$y = kx + b$$
- $y$:因变量(房价)
- $x$:自变量(面积)
- $k$:斜率
- $b$:截距
4.2 机器学习中的线性回归公式
$$y = Wx + B$$
- $W$:权重(Weight),对应斜率
- $B$:偏置(Bias),对应截距
一元线性回归不涉及平方项;若涉及平方项则为多元/多项式回归。
5 代码示例
本课无完整代码,但提及后续KNN入门实操将涉及线性回归概念。
6 重难点与易错提醒
- ❗重点:模型的核心任务是计算
y_test——已知x_train、y_train、x_test,预测y_test。 - ❗重点:机器学习中,斜率称为"权重(Weight, W)",截距称为"偏置(Bias, B)"。
- ⚠️易错:Bias 的正确拼写是 "Bias",不要写成 "BIOS"(基本输入输出系统)。
- ⚠️易错:测试集的
x_test已知,但y_test未知,需要模型预测。 - 💡深入理解:拟合回归线的特征是尽量穿过更多点,剩余点分布在直线两侧。
7 课堂问答精选
Q: 机器学习模型的核心任务是什么?
A: 模型的核心任务是计算 y_test。已知训练集的特征 x_train 和标签 y_train,以及测试集的特征 x_test,模型需要预测测试集的标签 y_test。
Q: 机器学习中的权重和偏置对应数学中的什么概念?
A: 权重(Weight, W)对应斜率,偏置(Bias, B)对应截距。本质相同,只是命名不同。
8 本课小结
- 机器学习属于基于模型的学习,从数据中自动学习规律。
- 核心术语:样本(一行数据)、特征(X轴)、标签(Y轴)、训练集(已知数据)、测试集(待预测数据)。
- 模型任务:已知
x_train、y_train、x_test,计算y_test。 - 线性回归公式:$y = Wx + B$,其中 $W$ 为权重,$B$ 为偏置。
- 拟合回归线:尽量穿过更多点,剩余点分布在两侧。
9 延伸思考与实践
- 思考:基于规则的学习和基于模型的学习,各自的适用场景是什么?
- 思考:为什么训练集的质量会直接影响模型的预测准确度?
- 预告:后续将学习KNN算法入门实操。