机器学习|无监督学习、推荐系统与强化学习

要来台风了🌀,真让人惶恐。祝食用愉快~🫠

1. 无监督学习:聚类、异常检测与降维

其中 是样本 当前被分配的聚类中心索引, 是第 个聚类中心的位置。

系统整体概率密度为各特征概率的乘积:

2. 推荐系统 (Recommender Systems)

个性化推荐是互联网最核心的落地场景。

设用户数 ,项目数 。 表示用户 对项目 进行了评分, 为评分值。

同时学习所有用户的 和所有项目的特征 :

对于一个完全没有评分的新用户,直接优化会使其 ,导致所有预测评分均为0。解决方法是将每个项目的评分减去该项目的平均分 ,在模型预测出 后再加上 ,使新用户的预测评分为项目均值。

面对海量商品(百万级/千万级),无法直接用复杂的双塔模型计算每个商品的得分。

  1. 检索阶段 (Retrieval): 采用简单快速的规则或轻量模型(如协同过滤、相似分类等),快速筛选出几百个候选项目。
  2. 重排阶段 (Ranking): 将检索出的候选项目送入深度双塔模型进行精准打分、排序,并结合去重、多样性控制等业务逻辑展示给用户。

3. 强化学习 (Reinforcement Learning)

强化学习解决了智能体在复杂环境中如何通过试错,自主学习最优决策路径(Policy)的问题。

                    ┌──────────────┐
│ 环境 │
└─┬──────────▲─┘
│ 状态 s │ 动作 a
│ 奖励 R │
┌─▼──────────┴─┐
│ 智能体 │
└──────────────┘

从 时刻开始的累计折扣奖励:

在状态 下执行动作 ,之后全部采取最优策略所能获得的期望总回报。

Q函数的基石,体现了强化学习的动态规划思想。

即:当前状态-动作对的价值,等于立即获得的奖励,加上到达下一状态 后,采取最优动作 所能获得的最大期望折现价值。

在火星探测器、月球着陆器等连续控制任务中,状态空间是连续且无限的(如位置、角度、速度)。我们无法构建 Q 表格,必须使用神经网络来逼近 函数。

为了避免陷入局部最优,智能体需要探索环境。

随着训练的进行, 会逐渐衰减。

智能体的历史轨迹 会被存入回放池。训练时,随机抽取小批量(Mini-batch)的非相关历史数据进行梯度下降,打破了时间序列数据间的强相关性,使训练更加稳定。

  1. 目标网络与软更新 (Target Network & Soft Updates):

为了防止网络预测的 值与目标值互相追逐导致振荡,使用一个结构相同但参数更新缓慢的“目标网络”来计算贝尔曼方程中的目标值 。 每次训练更新主网络参数 后,对目标网络参数 进行软更新:

强化学习在游戏(如围棋、Atari)及受控物理模拟环境(如月球着陆器、机器人操作)中表现卓越。但在实际工程中,它面临着样本效率低下(需要数百万次交互)以及仿真到现实(Sim-to-Real)鸿沟的巨大挑战(正如吴恩达与 Chelsea Finn 在探讨中所指出,目前在机器人及自动驾驶等物理实体的落地中,安全性和数据高效获取依然是前沿攻坚方向)。