POPGym:部分可观测强化学习基准测试
机器学习
2023-03-06 v1 人工智能
机器人学
摘要
强化学习(RL)的真实世界应用常常是部分可观测的,因此需要记忆。尽管如此,当代的RL基准测试和库仍很大程度上忽视了部分可观测性。我们引入了部分可观测过程 Gym (Partially Observable Process Gym, POPGym),这是一个由两部分组成的库,包含(1)一组多样的15个部分可观测环境,每个环境具有多种难度,以及(2)13种记忆模型基线的实现——这是单一RL库中最多的。现有的部分可观测基准往往固守于3D视觉导航,其计算开销大且仅为一种POMDP。相比之下,POPGym环境多样、产生更小的观测、使用更少内存,并且常能在消费级GPU上两小时内训练收敛。我们在流行的RLlib框架之上实现了我们的高层记忆API与记忆基线,提供了与各种训练算法、探索策略和分布式训练范式的即插即用兼容。利用POPGym,我们执行了迄今为止最大规模的RL记忆模型对比。POPGym可在 https://github.com/proroklab/popgym 获取。
引用
@article{arxiv.2303.01859,
title = {POPGym: Benchmarking Partially Observable Reinforcement Learning},
author = {Steven Morad and Ryan Kortvelesy and Matteo Bettini and Stephan Liwicki and Amanda Prorok},
journal= {arXiv preprint arXiv:2303.01859},
year = {2023}
}