MEAL:面向持续多代理 reinforcement learning 的基准
人工智能
2025-09-09 v2
摘要
基准在强化学习(RL)算法的开发与分析中发挥着关键作用,环境的可得性强烈影响研究。特别是公平多代理设置下的持续学习(CL)尚未得到充分探索。为此,我们引入 MEAL(Multi-agent Environments for Adaptive Learning),首个专为持续多代理强化学习(CMARL)设计的基准。现有 CL 基准在 CPU 上运行环境,导致计算瓶颈,限制了任务序列的长度。MEAL 利用 JAX 实现 GPU 加速,使其能够在普通台式机上在数小时内完成 100 个任务序列的持续学习。我们展示,粗略地将流行的 CL 和 MARL 方法组合仅在简单环境中表现良好,但在需要持续协调和适应的复杂环境中无法扩展。我们的消融研究识别了 CMARL 在 MEAL 上至关重要的架构和算法特征。
引用
@article{arxiv.2506.14990,
title = {MEAL: A Benchmark for Continual Multi-Agent Reinforcement Learning},
author = {Tristan Tomilin and Luka van den Boogaard and Samuel Garcin and Bram Grooten and Meng Fang and Yali Du and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2506.14990},
year = {2025}
}