中文

利用 POPGym Arcade 研究模型无关强化学习中的记忆

机器学习 2026-05-28 v7 人工智能 机器人学

摘要

我们应如何分析深度强化学习中的记忆?我们引入了在部分可观测性条件下分析策略的工具,揭示智能体如何利用记忆做出决策。为利用这些工具,我们提出了POPGym Arcade——一个受Atari启发、硬件加速的环境集合,共享单一的观测和动作空间。每个环境提供完全可观测和部分可观测的变体,使关于可观测性的反事实研究成为可能。我们发现受控研究对于公平比较是必要的,并识别出一种病理现象:价值函数将信用模糊分配到无关的历史上。利用这种病理现象,我们展示了分布外场景如何污染记忆,将策略扰动到遥远的未来。我们的代码可在 https://github.com/bolt-research/popgym-arcade 获取。

关键词

引用

@article{arxiv.2503.01450,
  title  = {Investigating Memory in Model-Free RL with POPGym Arcade},
  author = {Zekang Wang and Zhe He and Borong Zhang and Edan Toledo and Steven Morad},
  journal= {arXiv preprint arXiv:2503.01450},
  year   = {2026}
}

备注

Appear at ICML 2026 as a Spotlight paper