中文

悬崖跳水:探索强化学习环境中的奖励曲面

机器学习 2022-09-22 v3 人工智能

摘要

可视化优化地形已在数值优化中带来许多基础性见解,并催生了对优化技术的新改进。然而,对强化学习所优化的目标("奖励曲面")的可视化仅在少数狭窄情境下曾被生成。本工作首次呈现了 Gym 中 27 个最广泛使用强化学习环境的奖励曲面及相关可视化。我们还在策略梯度方向上探索奖励曲面,并首次表明许多流行强化学习环境具有频繁的"悬崖"(期望回报的突然大幅下降)。我们证明 A2C 经常从这些悬崖"跳水"进入参数空间的低奖励区域,而 PPO 规避了它们,证实了关于 PPO 相较先前方法性能提升的普遍直觉。我们还引入了一个高度可扩展的库,使研究人员未来能轻松生成这些可视化。我们的发现为解释现代 RL 方法的成功与失败提供了新直觉,且我们的可视化以新颖方式具体刻画了强化学习智能体的若干失败模式。

关键词

引用

@article{arxiv.2205.07015,
  title  = {Cliff Diving: Exploring Reward Surfaces in Reinforcement Learning Environments},
  author = {Ryan Sullivan and J. K. Terry and Benjamin Black and John P. Dickerson},
  journal= {arXiv preprint arXiv:2205.07015},
  year   = {2022}
}

备注

Accepted at ICML 2022 Camera-Ready Version