机器学习|神经网络、监督学习与树模型

吴恩达讲解的后续一parts,都是比较基础的内容。祝食用愉快~😋

1. 神经网络与前向传播 (Neural Networks & Forward Propagation)

每个神经元接收输入向量 ,与其对应的权重向量 进行点积,加上偏置 ,再通过激活函数 得到输出 (激活值)。 对于第 层的第 个神经元,其计算公式为:

其中, 为前一层的输出向量(输入层 )。

在代码和计算硬件中,通过矩阵化可以实现并行加速。设 为第 层的权重矩阵(每一列代表一个神经元的权重向量), 为偏置向量:

在 TensorFlow 中,数据通常以张量(Tensors)形式流动

2. 激活函数的选择与多分类问题

若不使用非线性激活函数,无论叠加多少层神经网络,其整体输出依然是输入的线性组合,无法拟合非线性边界。

当分类类别 时,输出层采用 Softmax 激活函数,将输出转化为对应各个类别的概率分布。对于第 个类别的预测概率 :

在 TensorFlow 中,若直接计算 极易发生数值溢出(极小或极大)。改进的做法是在损失函数中使用 from_logits=True,让 TensorFlow 将 Softmax 运算与交叉熵损失函数(Cross-Entropy Loss)在数学上进行合并简化,以提高计算精度。

区分于多分类(多选一),多输出分类旨在预测一个样本同时拥有的多个标签。例如:一张图像中是否同时包含【行人、车辆、交通灯】。其实现方式为在输出层设置多个 Sigmoid 神经元,分别对应各个标签的二分类。

3. 深度学习优化

相比于传统梯度下降(固定学习率 ),Adam (Adaptive Moment Estimation) 算法能够针对每个参数动态调整学习率。若某参数的梯度始终朝向同一方向,Adam 会加速其更新;若梯度频繁震荡,则会减小其步长,从而极大地加快了训练收敛速度。

全连接层(Dense)参数量大,容易过拟合。在处理图像等空间相关数据时,引入卷积层 (Convolutional Layer),通过局部感受野和权重共享,极大减少了参数量并保留了空间拓扑结构。

4. 树模型与集成学习 (Decision Trees & Ensemble Methods)

除了神经网络,树模型是处理表格数据 (Tabular Data) 最强有力的工具。

  1. 选择分割:信息增益 (Information Gain, IG): 选择能使分裂后子节点熵降幅最大的特征进行分裂。
  1. 分类与连续特征处理:

    • 离散特征: 若是多分类特征,可采用 独热编码 (One-hot Encoding) 转化为二进制特征。
    • 连续特征: 对其进行排序,测试不同的分裂阈值(如 ),选择信息增益最大的阈值。
  2. 回归树 (Regression Trees): 分割标准不再是信息熵,而是使分裂后子节点的方差(Variance)或均方误差(MSE)降到最低,叶子节点预测值为该叶子内所有样本的均值。