中文

BEDD:用于训练和基准测试求解模糊任务的智能体的 MineRL BASALT 评估与演示数据集

人工智能 2023-12-06 v1

摘要

MineRL BASALT 竞赛通过 Minecraft 中的四项难以明确规范的任务(例如创建并拍摄瀑布),促进了从人类反馈中学习的进步。鉴于两届 BASALT 竞赛的完成,我们向社区提供了一个通过 BASALT 评估与演示数据集(BEDD)形式化的基准,作为算法开发和性能评估的资源。BEDD 包含来自近 14,000 个人类玩家在 Minecraft 中完成 BASALT 任务的 2600 万个图像-动作对。它还包含超过 3,000 次对人类和算法智能体的密集成对人类评估。这些比较作为评估新开发算法的固定初步排行榜。为了实现这种比较,我们提供了一个简化的代码库,用于针对排行榜对新算法进行基准测试。除了展示这些数据集外,我们还对两个数据集的数据进行了详细分析,以指导算法的开发和评估。发布的代码和数据可在 https://github.com/minerllabs/basalt-benchmark 获取。

关键词

引用

@article{arxiv.2312.02405,
  title  = {BEDD: The MineRL BASALT Evaluation and Demonstrations Dataset for Training and Benchmarking Agents that Solve Fuzzy Tasks},
  author = {Stephanie Milani and Anssi Kanervisto and Karolis Ramanauskas and Sander Schulhoff and Brandon Houghton and Rohin Shah},
  journal= {arXiv preprint arXiv:2312.02405},
  year   = {2023}
}

备注

NeurIPS 2023 Datasets and Benchmarks Oral. Dataset links are available on Github: https://github.com/minerllabs/basalt-benchmark