迈向鲁棒且领域无关的强化学习竞赛
机器学习
2021-06-08 v1 人工智能
神经与进化计算
机器人学
机器学习
摘要
强化学习竞赛构成了标准研究基准的基础,推动了前沿技术的进展,并塑造了该领域的方向。尽管如此,大多数挑战都遭受同样的根本性问题:针对所提出挑战的参与者解决方案通常是领域特定的、偏向于最大化利用计算资源,并且不能保证可复现。在本文中,我们提出了一种新的竞赛设计框架,促进克服这些障碍的算法的发展。我们提出了实现这一目标的四个核心机制:提交重训练、领域随机化、通过领域混淆去语义化,以及限制竞赛计算和环境样本预算。为证明该设计的有效性,我们提出、组织并运行了MineRL 2020样本高效强化学习竞赛。在这项工作中,我们描述了竞赛的组织成果,并表明最终的参与者提交是可复现的、非特定于竞赛环境的,并且是样本/资源高效的,尽管竞赛任务十分困难。
引用
@article{arxiv.2106.03748,
title = {Towards robust and domain agnostic reinforcement learning competitions},
author = {William Hebgen Guss and Stephanie Milani and Nicholay Topin and Brandon Houghton and Sharada Mohanty and Andrew Melnik and Augustin Harter and Benoit Buschmaas and Bjarne Jaster and Christoph Berganski and Dennis Heitkamp and Marko Henning and Helge Ritter and Chengjie Wu and Xiaotian Hao and Yiming Lu and Hangyu Mao and Yihuan Mao and Chao Wang and Michal Opanowicz and Anssi Kanervisto and Yanick Schraner and Christian Scheller and Xiren Zhou and Lu Liu and Daichi Nishio and Toi Tsuneda and Karolis Ramanauskas and Gabija Juceviciute},
journal= {arXiv preprint arXiv:2106.03748},
year = {2021}
}
备注
20 pages, several figures, published PMLR