Craftax:面向开放端强化学习的极速基准
机器学习
2024-06-04 v2
摘要
基准测试在强化学习 (RL) 算法的开发与分析中起着至关重要的作用。我们发现,现有用于开放端学习研究的基准测试可归为两类:要么对于有意义的研究而言速度过慢,需要巨大的计算资源,如 Crafter、NetHack 和 Minecraft;要么复杂度不足,无法构成重大挑战,如 Minigrid 和 Procgen。为解决这一问题,我们首先推出了 Craftax-Classic:这是使用 JAX 从头重写的 Crafter,其运行速度比原生 Python 版本快达 250 倍。使用单个 GPU,包含 10 亿次环境交互的 PPO 运行可在不到一小时内完成,并平均达到最优奖励的 90%。为了提供更具吸引力的挑战,我们推出了主要的 Craftax 基准,这是对 Crafter 机制的重大扩展,并融入了源自 NetHack 的元素。解决 Craftax 需要深度探索、长期规划与记忆,以及随着世界被逐步发现而不断适应新情境的能力。我们表明,包括全局和情节式探索以及无监督环境设计在内的现有方法,均未能在此基准上取得实质性进展。我们相信,Craftax 首次使得研究人员能够在有限的计算资源下,在复杂的开放端环境中进行实验。
引用
@article{arxiv.2402.16801,
title = {Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning},
author = {Michael Matthews and Michael Beukman and Benjamin Ellis and Mikayel Samvelyan and Matthew Jackson and Samuel Coward and Jakob Foerster},
journal= {arXiv preprint arXiv:2402.16801},
year = {2024}
}