方向夹制PPO
机器学习
2025-11-05 v1
摘要
近似政策优化(PPO)被广泛认为是最成功的深度强化学习算法之一,因其在广泛问题范围内的鲁棒性和有效性而闻名。PPO目标鼓励importance比值在当前和行为策略之间向“正确”方向移动——从importance抽样比值等于1开始,提高具有正优势的动作的比值,降低具有负优势的动作的比值。在更新这些“正确”方向区域的importance比值时,引入裁剪函数以防止过度优化。许多PPO变体已提出以扩展其成功,大多数变体通过修改“正确”方向区域的裁剪来改变目标的行为。然而,由于rollouts中的随机性和策略优化的随机性,我们观察到比值在PPO优化期间经常移动到“错误”方向。这一因素是PPO改进的关键限制因素,但已被很大程度忽视。为此,我们提出了Directional-Clamp PPO算法(DClamp-PPO),进一步惩罚向严格“错误”方向区域的动作,其中优势为正(负),且importance比值低于(高于) ( ),其中 为可调参数。通过在这些区域强制更陡峭的损失斜率(即夹制),实现该惩罚。我们展示了DClamp-PPO在各种MuJoCo环境中一致优于PPO及其变体,方法是通过聚焦于修改“正确”方向中目标的行为实现的。该方法在理论和实证方面均表明,能更好地避免“错误”更新,同时将importance比值保持在接近1的范围内。
关键词
引用
@article{arxiv.2511.02577,
title = {Directional-Clamp PPO},
author = {Gilad Karpel and Ruida Zhou and Shoham Sabach and Mohammad Ghavamzadeh},
journal= {arXiv preprint arXiv:2511.02577},
year = {2025}
}