没有表征,没有信任:连接 PPO 中的表征、坍缩与信任问题
机器学习
2024-11-21 v3
摘要
强化学习(RL)因其固有的非平稳性而充满挑战,因为在训练期间,智能体观察到的状态和奖励取决于其变化的策略。因此,深层 RL 网络必须具备适应新观察和拟合新目标的能力。然而,先前的研究发现,在非平稳性下训练的网络表现出无法继续学习的现象,即学习力丧失,最终导致性能坍缩。对于基于价值的 off-policy 深度 RL 方法,已将这一现象与表征秩的下降以及拟合随机目标的能力(称为容量损失)相关联。尽管这种关联通常归因于非平稳性下的神经网络学习,但在基于策略的优化方法中,对表征动力学的细致研究仍缺乏。本文在 Atari 和 MuJoCo 环境中对 PPO 的表征动力学进行经验性研究,揭示 PPO 智能体也受到特征秩恶化和容量损失的影响。我们表明,这种恶化受到更强非平稳性的加剧,最终导致 actor 的性能坍缩,尽管 critic 的性能良好。我们思考为什么信任区域(特定于诸如 PPO 之类的方法)无法缓解或预防坍缩,并在表征坍缩与信任区域退化之间找到了联系,一方面加剧另一方面。最后,我们提出了 Proximal Feature Optimization(PFO),这是一种新的辅助损失,结合其他干预措施,表明对表征动力学进行正则化可缓解 PPO 智能体的性能坍缩。
引用
@article{arxiv.2405.00662,
title = {No Representation, No Trust: Connecting Representation, Collapse, and Trust Issues in PPO},
author = {Skander Moalla and Andrea Miele and Daniil Pyatko and Razvan Pascanu and Caglar Gulcehre},
journal= {arXiv preprint arXiv:2405.00662},
year = {2024}
}
备注
NeurIPS2024 version. Code and run histories are available at https://github.com/CLAIRE-Labo/no-representation-no-trust