中文

MineRL BASALT 基于人类反馈学习的竞赛

机器学习 2021-07-06 v1 人工智能

摘要

过去十年中,深度学习研究受到显著更多的关注,许多公开的成功案例已展示其潜力。因此,这些系统正被整合进商业产品中。由此带来一个额外的挑战:我们如何构建能够解决没有清晰、明确定义规范的任务的 AI 系统?尽管已提出多种解决方案,本次竞赛我们特别关注其中之一:从人类反馈中学习。我们不是使用预定义的奖励函数或使用具有预定义类别的标注数据集来训练 AI 系统,而是使用源自某种形式人类反馈的学习信号来训练 AI 系统,该信号可随任务理解的变化或 AI 系统能力的提升而随时间演化。MineRL BASALT 竞赛旨在推动这一类重要技术的研究。我们在 Minecraft 中设计了一套四个任务,预期难以写出硬编码的奖励函数。这些任务由一段自然语言描述定义:例如“创建一个瀑布并拍摄其风景照”,并附有补充说明细节。参与者必须为每个任务训练一个独立的智能体,可使用任意方法。智能体随后由读过任务描述的人类进行评估。为帮助参与者上手,我们提供了每个任务上的人类演示数据集,以及利用这些演示的模仿学习基线。我们希望本次竞赛能提升我们构建符合设计者意图的 AI 系统的能力,即便该意图难以形式化。除了让 AI 能解决更多任务外,这也能实现对 AI 系统更有效的监管,并在价值对齐问题上取得进展。

关键词

引用

@article{arxiv.2107.01969,
  title  = {The MineRL BASALT Competition on Learning from Human Feedback},
  author = {Rohin Shah and Cody Wild and Steven H. Wang and Neel Alex and Brandon Houghton and William Guss and Sharada Mohanty and Anssi Kanervisto and Stephanie Milani and Nicholay Topin and Pieter Abbeel and Stuart Russell and Anca Dragan},
  journal= {arXiv preprint arXiv:2107.01969},
  year   = {2021}
}

备注

NeurIPS 2021 Competition Track