噪声邻域中的策略优化:论连续控制中的回报地形
机器学习
2024-04-12 v3
摘要
用于连续控制的深度强化学习智能体已知在其性能上随时间表现出显著的不稳定性。本工作中,我们通过研究回报地形(策略与回报之间的映射)为这些行为提供了新视角。我们发现流行算法遍历该地形的噪声邻域,其中对策略参数的单次更新会导致大范围的回报。通过采用这些回报的分布视角,我们绘制了地形图,刻画了策略空间中易失败的区域,并揭示了一个隐藏的策略质量维度。我们展示了地形表现出令人惊讶的结构,通过在参数空间中找到简单路径可改善策略的稳定性。最后,我们开发了一种分布感知过程,其寻找此类路径,远离噪声邻域以改进策略的鲁棒性。综上,我们的结果为智能体的优化、评估与设计提供了新见解。
引用
@article{arxiv.2309.14597,
title = {Policy Optimization in a Noisy Neighborhood: On Return Landscapes in Continuous Control},
author = {Nate Rahn and Pierluca D'Oro and Harley Wiltzer and Pierre-Luc Bacon and Marc G. Bellemare},
journal= {arXiv preprint arXiv:2309.14597},
year = {2024}
}
备注
NeurIPS 2023 Accepted Paper. The first two authors contributed equally