中文

SRMT:多代理终身路径规划的共享内存

机器学习 2025-01-24 v1 人工智能 多智能体系统

摘要

多代理强化学习(MARL)在解决各种环境下的合作和竞争多代理问题方面取得了显著进展。MARL 的一个主要挑战在于需要显式预测代理人的行为才能实现协作。为解决此问题,我们提出了共享循环记忆 Transformer(SRMT),该方法通过对池化和全局广播 individual working memories 来扩展记忆 Transformer 到多代理设置,使代理人能够隐式交换信息并协调他们的行动。我们在需要代理人通过狭窄走廊的 toy Bottleneck 导航任务中的部分可观测多代理路径规划问题上评估了 SRMT。对于 Bottleneck 任务,SRMT 在稀疏奖励情况下的表现尤其突出,并能有效地推广到训练期间未见过的更长走廊。在 POGEMA 地图(包括迷宫、随机和 MovingAI)上,SRMT 与最新的 MARL、混合和基于规划的算法保持竞争力。这表明将共享循环记忆纳入基于 Transformer 的架构可以增强去中心化多代理系统的协调。训练和评估的源代码可在 GitHub 上获取:https://github.com/Aloriosa/srmt。

关键词

引用

@article{arxiv.2501.13200,
  title  = {SRMT: Shared Memory for Multi-agent Lifelong Pathfinding},
  author = {Alsu Sagirova and Yuri Kuratov and Mikhail Burtsev},
  journal= {arXiv preprint arXiv:2501.13200},
  year   = {2025}
}

备注

16 pages, 11 figures