Multi-Agent Craftax:面向大规模多智能体强化学习的基准测试
机器学习
2025-11-10 v1 多智能体系统
摘要
多智能体强化学习(MARL)的进展需要具备挑战性的基准测试,以衡量当前方法的极限。然而,现有基准测试往往针对狭窄的短期 horizons 挑战,无法充分检验多智能体系统中固有的长期依赖性和泛化能力。为此,我们首先提出 \textit{Craftax-MA}:这是一种扩展流行开放式强化学习环境 Craftax 的多智能体版本,支持多个智能体并在单一环境中评估广泛的通用能力。该环境基于 JAX 编写,运行速度极快,使用 2500 万环境交互进行训练可在不到一小时内完成。为为 MARL 提供更具挑战性的任务,我们还提出 \textit{Craftax-Coop}——一种引入异构智能体、交易及更多机制的扩展版本,这些机制需要智能体之间实现复杂的合作才能成功。我们提供的分析表明,现有算法在本基准测试的关键挑战方面(包括长期信用分配、探索与合作)仍表现不足,并认为其具有推动 MARL 长期研究的潜力。
引用
@article{arxiv.2511.04904,
title = {Multi-Agent Craftax: Benchmarking Open-Ended Multi-Agent Reinforcement Learning at the Hyperscale},
author = {Bassel Al Omari and Michael Matthews and Alexander Rutherford and Jakob Nicolaus Foerster},
journal= {arXiv preprint arXiv:2511.04904},
year = {2025}
}