机器学习大纲介绍
1 课程概览
本课介绍机器学习阶段的整体大纲规划,涵盖课程时长安排、核心知识模块(机器学习概述、KNN、线性回归、逻辑回归、决策树、集成学习、聚类KMeans)以及综合实战项目。重点强调机器学习建模流程的六个步骤,并指出本阶段代码与数学推导并重的学习特点。
2 核心概念与定义
- 机器学习(Machine Learning):让计算机从数据中自动学习规律的方法。
- AI三要素:算法(Algorithm)、算力(Compute)、数据(Data)。
- 机器学习算法分类:监督学习(Supervised Learning)、无监督学习(Unsupervised Learning)、半监督学习(Semi-supervised Learning)、强化学习(Reinforcement Learning)。
- 特征工程(Feature Engineering):从原始数据中提取、处理、选择有效特征的过程。
- K近邻算法(K-Nearest Neighbors, KNN):通过最近的K个邻居判断样本类别的算法。
3 算法与模型详解
3.1 机器学习建模流程(六步法)
- 获取数据:加载原始数据集。
- 数据基本处理:数据预处理(类似数据分析中的预处理)。
- 特征工程:包含五个子领域(见下文)。
- 模型训练:使用训练集训练模型。
- 模型评估:评估模型性能是否达标。
- 模型预测:使用模型对新数据进行预测。
注:第5步与第6步顺序可能互换,有时先预测再评估。
3.2 特征工程的五个子领域
- 特征提取(Feature Extraction):从原始数据中提取特征。
- 特征预处理(Feature Preprocessing):对特征进行归一化、标准化等处理。
- 特征降维(Dimensionality Reduction):降低特征维度。
- 特征选择(Feature Selection):选择最有价值的特征。
- 特征组合(Feature Combination):组合多个特征生成新特征。
3.3 KNN算法思想
- 核心思想:近朱者赤,近墨者黑。通过距离运算,根据最近的K个邻居的类别判断未知样本的类别。
- 应用示例:已知10部电影的武打镜头、亲吻镜头、拥抱镜头时长及类别,判断第11部电影的类别。
- 能力:既能做分类,也能做回归。
3.4 课程知识模块
| 模块 | 内容 | 备注 |
|---|---|---|
| 机器学习概述 | 概念、建模流程 | 纯理论 |
| KNN算法 | 距离度量、特征预处理、案例 | 入门级 |
| 线性回归 | 正规方程、梯度下降 | 涉及求导 |
| 逻辑回归 | 分类算法 | — |
| 决策树 | ID3、C4.5、CART | 最难,公式推导约1小时 |
| 集成学习 | Bagging、Boosting | 三个臭皮匠顶个诸葛亮 |
| 聚类KMeans | 无监督聚类 | — |
| 综合案例 | 能源之星等 | 约1.5天讲解+1.5天实践 |
4 数学原理与推导
本课为大纲介绍,无具体数学推导。后续线性回归章节将涉及导数、偏导数知识。
5 代码示例
本课无代码示例,实操集中在最后一节KNN入门部分。
6 重难点与易错提醒
- ❗重点:机器学习建模六步流程必须熟记——获取数据、数据预处理、特征工程、模型训练、模型评估、模型预测。
- ⚠️易错:特征选择与特征提取概念容易混淆,需重点区分。
- ❗重点:本阶段代码与数学并重,不能像以前学Linux/SQL/Pandas那样只关注业务逻辑。
- 💡深入理解:KNN的代码流程如果能背下来,后续几天的API学习基本完成,因为各算法的动作流程一致。
7 课堂问答精选
Q: 机器学习项目研发流程与数据挖掘流程的区别是什么?
A: 数据挖掘流程为:数据加载→预处理→统计分析→导出结果→可视化。机器学习流程类似,但将统计分析等步骤替换为特征工程、模型训练、模型评估、模型预测。
Q: 哪个部分是学习重点?
A: 每一个部分都是重点,面试时都有可能被问到,不能掉以轻心。
8 本课小结
- 机器学习阶段约11天,含8天基础+2-3天实战项目。
- 建模六步流程:获取数据→预处理→特征工程→模型训练→模型评估→模型预测。
- 特征工程包含五个子领域:提取、预处理、降维、选择、组合。
- KNN核心思想为"近朱者赤,近墨者黑",通过距离运算判断类别。
- 本阶段代码与数学并重,需多花心思。
9 延伸思考与实践
- 思考:如何根据业务场景选择合适的机器学习算法?
- 实践:尝试将KNN的建模流程背诵下来,为后续学习打基础。