机器学习|基础知识学习笔记

来自吴恩达《机器学习》,闲暇的时候看了一点,比较基础所以看的很快,但是也补充了一些基础知识。老师很风趣幽默,点赞👍爱来自华东师大。祝食用愉快~~🐟

引言:机器学习是什么

机器学习的分类

类型 数据是否有标签 学什么 典型任务
监督学习 Supervised 有标签 (x, y) 从 x 到 y 的映射 回归、分类
无监督学习 Unsupervised 无标签,只有 x 数据里自发存在的结构 聚类、降维、异常检测
半监督 / 自监督 少量标签 / 自造标签 用海量无标注数据预训练 大模型预训练
强化学习 RL 无标签,只有奖励信号 在环境中试错的策略 下棋、机器人控制

监督学习

回归 Regression 分类 Classification
输出 连续的任意数值 有限个离散的类别标签
例子 房价、气温、销量 垃圾邮件 / 肿瘤良恶性 / 手写数字
常用模型 线性回归、多项式回归 逻辑回归、决策树、神经网络

线性回归

1. 模型

线性拟合不够用时,可以构造 等特征做多项式(非线性)拟合——注意它本质上仍是“对参数线性”的线性回归。

2. 代价函数:均方误差 MSE

3. 梯度下降

逻辑回归(分类)

1. 不用线性回归

线性回归输出会跑到 0 1 之外,且一个远处的离群点就能把决策边界拽偏。

2. Sigmoid

输出被压到 (0,1),解释为 ;一般以 0.5 为阈值判定类别。

3. 决策边界 Decision Boundary

所对应的那条线/面,就是把两类分开的边界。

4. 代价函数(交叉熵)

5. 梯度下降

更新式子长得和线性回归一模一样:

但 的定义变了(里面套了 sigmoid),所以只是“形似神不似”hhhh

工程优化手段

手段 解决什么问题 具体做法
特征缩放 / 归一化 各特征量纲差太多 → 等高线椭长、梯度下降走 Z 字、收敛慢 除以最大值、均值归一化、Z-score 标准化
特征工程 原始特征表达力不足 组合/变换出新特征(如 长×宽 = 面积)、多项式特征
向量化 Vectorization 纯 for 循环太慢 用 NumPy 矩阵运算,底层并行(CPU SIMD / GPU),代码更短更快
正则化 Regularization 过拟合 在 后加惩罚项 ,压小参数、简化模型

关于拟合状态:

“ 所以更准确的说法是:特征缩放 + 向量化 = 训练得更快;正则化 = 泛化得更好。 ”

吴恩达与李飞飞的对谈

“ 我个人又看了他们放在课程里面的40多分钟的交谈,不得不说真是很厉害的人呢~这里是我看到后得到的一些观点总结 ”

小结

“ 休息的时候看看这个感觉还可以,感觉巩固了知识体系,之后打算再看一下后续的深度学习板块。总的来说讲的比较通俗易懂,整个概念过完了之后找些代码项目来练习理解一下就应该会好多了。我的计划是这样的,睡觉时间到了不过,先休息吧😴 ”