利用 POPGym Arcade 研究模型无关强化学习中的记忆
机器学习
2026-05-28 v7 人工智能
机器人学
摘要
我们应如何分析深度强化学习中的记忆?我们引入了在部分可观测性条件下分析策略的工具,揭示智能体如何利用记忆做出决策。为利用这些工具,我们提出了POPGym Arcade——一个受Atari启发、硬件加速的环境集合,共享单一的观测和动作空间。每个环境提供完全可观测和部分可观测的变体,使关于可观测性的反事实研究成为可能。我们发现受控研究对于公平比较是必要的,并识别出一种病理现象:价值函数将信用模糊分配到无关的历史上。利用这种病理现象,我们展示了分布外场景如何污染记忆,将策略扰动到遥远的未来。我们的代码可在 https://github.com/bolt-research/popgym-arcade 获取。
引用
@article{arxiv.2503.01450,
title = {Investigating Memory in Model-Free RL with POPGym Arcade},
author = {Zekang Wang and Zhe He and Borong Zhang and Edan Toledo and Steven Morad},
journal= {arXiv preprint arXiv:2503.01450},
year = {2026}
}
备注
Appear at ICML 2026 as a Spotlight paper