MineRL 2019基于人类先验的样本高效强化学习竞赛
机器学习
2021-01-20 v3 人工智能
机器学习
摘要
尽管深度强化学习在许多困难领域取得了突破,但这些成功需要越来越多的样本。由于最先进的强化学习(RL)系统所需样本数呈指数增长,其研发仅限于人工智能社区中不断萎缩的一小部分群体。同样,其中许多系统无法应用于环境样本昂贵的现实问题。解决这些局限需要新的、样本高效的方法。为促进该方向的研究,我们推出了基于人类先验的样本高效强化学习MineRL竞赛。竞赛的主要目标是推动算法的发展,使其能高效利用人类示范,大幅减少解决复杂、分层且稀疏环境所需的样本数。为此,我们引入:(1)Minecraft ObtainDiamond任务,一个需要长期规划、分层控制和高效探索方法的序贯决策环境;(2)MineRL-v0数据集,一个包含超过6000万状态-动作对的大规模人类示范集合,可重模拟为具有任意游戏状态和视觉修改的具体化轨迹。参与者将竞争开发在环境模拟器Malmo中有限样本下解决ObtainDiamond任务的系统。竞赛分为两轮,每轮向参赛者提供若干具有不同游戏纹理的数据集与环境配对版本。每轮结束时,参赛者提交其学习算法的容器化版本,随后这些版本将在保留的数据集-环境配对上从头训练/评估,在指定硬件平台上总计4天。
引用
@article{arxiv.1904.10079,
title = {The MineRL 2019 Competition on Sample Efficient Reinforcement Learning using Human Priors},
author = {William H. Guss and Cayden Codel and Katja Hofmann and Brandon Houghton and Noboru Kuno and Stephanie Milani and Sharada Mohanty and Diego Perez Liebana and Ruslan Salakhutdinov and Nicholay Topin and Manuela Veloso and Phillip Wang},
journal= {arXiv preprint arXiv:1904.10079},
year = {2021}
}
备注
accepted at NeurIPS 2019, 28 pages