BEDD:用于训练和基准测试求解模糊任务的智能体的 MineRL BASALT 评估与演示数据集
人工智能
2023-12-06 v1
摘要
MineRL BASALT 竞赛通过 Minecraft 中的四项难以明确规范的任务(例如创建并拍摄瀑布),促进了从人类反馈中学习的进步。鉴于两届 BASALT 竞赛的完成,我们向社区提供了一个通过 BASALT 评估与演示数据集(BEDD)形式化的基准,作为算法开发和性能评估的资源。BEDD 包含来自近 14,000 个人类玩家在 Minecraft 中完成 BASALT 任务的 2600 万个图像-动作对。它还包含超过 3,000 次对人类和算法智能体的密集成对人类评估。这些比较作为评估新开发算法的固定初步排行榜。为了实现这种比较,我们提供了一个简化的代码库,用于针对排行榜对新算法进行基准测试。除了展示这些数据集外,我们还对两个数据集的数据进行了详细分析,以指导算法的开发和评估。发布的代码和数据可在 https://github.com/minerllabs/basalt-benchmark 获取。
关键词
引用
@article{arxiv.2312.02405,
title = {BEDD: The MineRL BASALT Evaluation and Demonstrations Dataset for Training and Benchmarking Agents that Solve Fuzzy Tasks},
author = {Stephanie Milani and Anssi Kanervisto and Karolis Ramanauskas and Sander Schulhoff and Brandon Houghton and Rohin Shah},
journal= {arXiv preprint arXiv:2312.02405},
year = {2023}
}
备注
NeurIPS 2023 Datasets and Benchmarks Oral. Dataset links are available on Github: https://github.com/minerllabs/basalt-benchmark