XLand-100B:面向 in-context 强化学习的大规模多任务数据集
机器学习
2025-03-04 v3 人工智能
摘要
跟随大规模语言和计算机视觉模型中 in-context 学习范式的成功,最近涌现的 in-context 强化学习领域正迎来快速发展。然而,由于所有实验都在简单环境中进行且数据集规模较小,该领域的发展受限于缺乏具有挑战性的基准。我们提出 XLand-100B,这是一个基于 XLand-MiniGrid 环境的大规模 in-context 强化学习数据集,以缓解这一问题。数据集包含 nearly 个不同任务的完整学习历史,覆盖 B 次转移和 个剧集。收集该数据集耗用了 50,000 个 GPU 小时,远超大多数学术实验室的能力。我们随数据集提供了复现或进一步扩展的实用工具。我们还对常见的 in-context RL 基线方法进行基准测试,表明它们在面对新型多样化任务时难以泛化。通过这一大规模努力,我们旨在 democratize in-context 强化学习领域的研究,为进一步规模化奠定坚实基础。
引用
@article{arxiv.2406.08973,
title = {XLand-100B: A Large-Scale Multi-Task Dataset for In-Context Reinforcement Learning},
author = {Alexander Nikulin and Ilya Zisman and Alexey Zemtsov and Vladislav Kurenkov},
journal= {arXiv preprint arXiv:2406.08973},
year = {2025}
}
备注
ICLR 2025, Poster, Source code: https://github.com/dunnolab/xland-minigrid-datasets