强化学习基准中样本效率与泛化的度量:NeurIPS 2020 Procgen 基准
机器学习
2021-03-30 v1 人工智能
摘要
NeurIPS 2020 Procgen 竞赛被设计为一个集中式基准,具有明确定义的任务,用于度量强化学习中的样本效率与泛化。泛化仍是深度强化学习中最基本的挑战之一,然而我们尚无足够的基准来度量社区在强化学习泛化方面的进展。我们提出了一个集中式强化学习基准的设计,该基准通过对数千个用户提交代码库的训练和滚动阶段进行端到端可扩展评估,来帮助度量强化学习中的样本效率与泛化。我们在已有的 Procgen 基准之上设计该基准,通过定义清晰的任务并标准化端到端评估设置。该设计旨在为希望设计此类基准未来迭代的研究者最大化灵活性,同时施加必要的实际约束以允许像这样的系统扩展。本文介绍了竞赛设置,以及通过该设置在 NeurIPS 2020 竞赛迭代中识别出的顶尖方案的细节与分析。
引用
@article{arxiv.2103.15332,
title = {Measuring Sample Efficiency and Generalization in Reinforcement Learning Benchmarks: NeurIPS 2020 Procgen Benchmark},
author = {Sharada Mohanty and Jyotish Poonganam and Adrien Gaidon and Andrey Kolobov and Blake Wulfe and Dipam Chakraborty and Gražvydas Šemetulskis and João Schapke and Jonas Kubilius and Jurgis Pašukonis and Linas Klimas and Matthew Hausknecht and Patrick MacAlpine and Quang Nhat Tran and Thomas Tumiel and Xiaocheng Tang and Xinwei Chen and Christopher Hesse and Jacob Hilton and William Hebgen Guss and Sahika Genc and John Schulman and Karl Cobbe},
journal= {arXiv preprint arXiv:2103.15332},
year = {2021}
}