机器学习核心名词介绍
1 课程概览
本课详细讲解机器学习的核心术语:样本、特征、标签、训练集、测试集,并通过黑马程序员就业薪资表案例直观展示这些概念的含义与相互关系。重点强调四个关键变量名(x_train、y_train、x_test、y_test)的记忆与理解,为后续编写代码奠定基础。
2 核心概念与定义
- 样本(Sample):数据集中的每一行数据,即一条记录。
- 特征(Feature):用于分析的数据列,已知的数据字段,也称为属性。
- 标签(Label/Target):需要预测的结果列,模型的目标值。
- 数据集(Dataset):用来训练或测试的数据集合,由多个样本组成。
- 训练集(Training Set):用于训练模型的数据,包含已知特征和标签。
- 测试集(Test Set):用于测试模型预测能力的数据。
- 训练集与测试集比例:一般为8:2或7:3,7:3居多。
3 算法与模型详解
3.1 核心术语图解(以就业薪资预测为例)
| 学科 | 考试成绩 | 学历 | 工作地点 | → 薪资 |
|---|---|---|---|---|
| 特征 | 特征 | 特征 | 特征 | 标签 |
| ←——————— X ———————→ | Y |
- 每一行 = 一个样本
- 左侧各列 = 特征(Feature)
- 右侧结果列 = 标签(Label/Target)
3.2 四个关键变量
| 变量名 | 含义 | 说明 |
|---|---|---|
x_train | 训练集特征 | 已知,用于训练 |
y_train | 训练集标签 | 已知,用于训练 |
x_test | 测试集特征 | 已知,用于预测输入 |
y_test | 测试集标签 | 未知,模型需要预测的结果 |
❗机器学习有标签的核心任务:已知
x_train、y_train、x_test,求y_test。
3.3 记忆方法
- 特征=X轴,标签=Y轴:左边是X,右边是Y。
- 训练=train,测试=test:训练集用train,测试集用test。
3.4 数据集划分
数据集(Dataset)
├── 训练集(Training Set, train)—— 用于训练模型
│ ├── x_train(训练集特征)
│ └── y_train(训练集标签)
└── 测试集(Test Set, test)—— 用于测试模型
├── x_test(测试集特征)
└── y_test(测试集标签,待预测)
比例一般为8:2或7:3,具体由公司业务决定。
4 数学原理与推导
本课无数学推导。
5 代码示例
后续代码中变量命名约定(Python):
# 训练集
x_train # 训练集特征
y_train # 训练集标签
# 测试集
x_test # 测试集特征
y_test # 测试集标签(模型预测目标)
6 重难点与易错提醒
- ❗重点:四个变量名必须熟记——
x_train、y_train、x_test、y_test,后续代码中变量名将统一使用这些名称。 - ❗重点:模型的核心任务是计算
y_test——已知前三项,预测第四项。 - ⚠️易错:测试集的
x_test已知,但y_test未知,需要模型预测。 - ⚠️易错:训练集与测试集比例一般为8:2或7:3,不要使用9:1或5:5等极端比例(除非公司明确要求)。
- 💡深入理解:样本是一行数据,数据集是多个样本组成的集合;特征是已知的数据列,标签是需要预测的结果列。
7 课堂问答精选
Q: 根据西瓜的色泽、根蒂、敲声判断好瓜坏瓜,如何划分x_train、y_train、x_test、y_test?
A:
- 色泽、根蒂、敲声等已知特征列 →
x_train - 好瓜/坏瓜的已知结果 →
y_train - 待预测西瓜的特征 →
x_test - 待预测西瓜的好瓜/坏瓜结果 →
y_test(模型预测目标)
8 本课小结
- 样本 = 一行数据;特征 = 分析字段(X);标签 = 预测结果(Y)。
- 数据集划分为训练集和测试集,比例一般为8:2或7:3。
- 四个关键变量:
x_train、y_train、x_test、y_test。 - 模型核心任务:已知
x_train、y_train、x_test,预测y_test。 - 记忆方法:特征=X轴,标签=Y轴;训练=train,测试=test。
9 延伸思考与实践
- 思考:为什么训练集和测试集的比例一般是7:3或8:2,而不是5:5?
- 实践:在脑海中建立数据集划分的图示画面,为后续编码做准备。