MineRL 2020基于人类先验的样本高效强化学习竞赛
机器学习
2021-01-28 v1 人工智能
机器学习
摘要
尽管深度强化学习已在诸多困难领域取得突破,但这些成功需要不断增加的样本量,仅让日益缩减的AI研究群体得以开展相关开发。解决这些局限需要新颖的、样本高效的方法。为推进该方向研究,我们提出第二届MineRL竞赛。竞赛的主要目标是促进算法开发,使算法能高效利用人类演示,大幅减少解决复杂、层次化、稀疏环境所需样本数。为此,参赛者在有限的环境样本复杂度预算下竞争开发系统,以求解Minecraft中的MineRL ObtainDiamond任务——一个需要长期规划、层次化控制和高效探索方法的序贯决策环境。竞赛分为两轮,每轮向参赛者提供多组具有不同游戏纹理与着色器的数据集与环境配对。每轮结束时,参赛者将容器化的学习算法提交至AIcrowd平台,在预留的数据集–环境配对上从头训练,于预指定硬件平台上总计4天。作为NeurIPS 2019 MineRL竞赛的后续,我们实现了新功能以扩大竞赛规模与影响力。应往届参赛者反馈,我们引入了第二个次要赛道,专注于除测试时外无任何环境交互访问权限的解决方案。进一步,我们通过实施若干新颖竞赛机制(包括动作空间随机化及观测与动作的去语义化)来促使与领域无关的提交。
引用
@article{arxiv.2101.11071,
title = {The MineRL 2020 Competition on Sample Efficient Reinforcement Learning using Human Priors},
author = {William H. Guss and Mario Ynocente Castro and Sam Devlin and Brandon Houghton and Noboru Sean Kuno and Crissman Loomis and Stephanie Milani and Sharada Mohanty and Keisuke Nakata and Ruslan Salakhutdinov and John Schulman and Shinya Shiroshita and Nicholay Topin and Avinash Ummadisingu and Oriol Vinyals},
journal= {arXiv preprint arXiv:2101.11071},
year = {2021}
}
备注
37 pages, initial submission, accepted at NeurIPS. arXiv admin note: substantial text overlap with arXiv:1904.10079