机器学习|系统工程与实践

天气好热,空调好贵www祝食用愉快~🫠

           [ 机器学习开发的迭代循环 ]
┌─────────┐
▼ │
┌─────────┐ │ (迭代优化)
│ 建立模型 │ │
└────┬────┘ │
▼ │
┌─────────┐ │
│ 诊断评估 ├────┘
│(偏差/方差)│
└────┬────┘
▼
┌─────────┐
│ 部署上线 │
└─────────┘

1. 模型评估与选择

2. 诊断偏差 (Bias) 与方差 (Variance)

训练集误差 很高,交叉验证集误差 同样很高。

训练集误差 很低,但交叉验证集误差 。

引入 正则化,正则化惩罚项为 :

必须建立一个合理的性能基准(如人类专家表现、现有最优模型、学术界前沿水平)。

绘制 和 随训练样本量 的变化曲线:

3. 迭代循环与项目生命周期

不要盲目尝试复杂算法,应人工检查 中被分类错误的样本(例如挑选100个错例),按错误类型归类(如“图像模糊”、“背景噪点”等),量化各类型占比,将精力优先投入到占比最高、最易解决的问题上。

当目标任务数据极少时,可以先在一个规模极其庞大的相关数据集上训练网络(Pre-training),然后将其参数复制到目标任务网络中,保持前几层参数不变或微调(Fine-tuning),利用在大数据上学到的通用特征表示。

机器学习模型容易放大训练数据中的偏见(如性别、种族歧视等)。必须确保数据集的多样性,评估模型在各亚群组上的表现,遵循科技向善的原则。

4. 倾斜数据集的评估指标

对于正负样本极度不平衡的数据集(如罕见病筛查,正例仅占 ),单纯看准确率(Accuracy)会产生欺骗性(即便全部预测为负,准确率也有 )。

真实正例 (Actual True) 真实负例 (Actual False)
预测正例 (Predicted True) 真正例 (TP) 假正例 (FP)
预测负例 (Predicted False) |假负例 (FN) 真负例 (TN)

为了综合评估,采用两者的调和平均数 F1-Score: