2021年基于人类反馈学习的BASALT竞赛回顾
人工智能
2022-04-15 v1
摘要
我们在第三十五届神经信息处理系统会议(NeurIPS 2021)上举办了首届MineRL基准:解决近乎真实任务的智能体(MineRL BASALT)竞赛。该竞赛旨在促进面向使用人类反馈学习(LfHF)技术解决开放世界任务的智能体研究。我们没有强制要求使用LfHF技术,而是用自然语言描述了在电子游戏Minecraft中需完成的四项任务,并允许参与者使用任何他们想用的方法来构建能够完成这些任务的智能体。各团队针对多种可能的人类反馈类型开发了多样化的LfHF算法。三个获胜团队实现了显著不同的方法,同时取得了相似的性能。有趣的是,它们的方法在不同任务上表现良好,验证了我们在竞赛中纳入这些任务的选择。尽管结果验证了竞赛的设计,但我们未能像姊妹竞赛MineRL Diamond那样获得众多的参与者和提交作品。我们推测了这一问题的原因,并为竞赛未来的迭代提出了改进建议。
引用
@article{arxiv.2204.07123,
title = {Retrospective on the 2021 BASALT Competition on Learning from Human Feedback},
author = {Rohin Shah and Steven H. Wang and Cody Wild and Stephanie Milani and Anssi Kanervisto and Vinicius G. Goecks and Nicholas Waytowich and David Watkins-Valls and Bharat Prakash and Edmund Mills and Divyansh Garg and Alexander Fries and Alexandra Souly and Chan Jun Shern and Daniel del Castillo and Tom Lieberum},
journal= {arXiv preprint arXiv:2204.07123},
year = {2022}
}
备注
Accepted to the PMLR NeurIPS 2021 Demo & Competition Track volume