中文

SrSv: 将顺序推演与顺序价值估计集成用于多智能体强化学习

人工智能 2025-03-04 v1 机器学习 多智能体系统

摘要

尽管多智能体强化学习 (MARL) 在各个领域显示出成功,但将其应用到大型真实系统仍面临重大挑战。主要是,真实环境的高复杂度加剧了信用分配问题,显著降低了训练效率。此外,大规模场景中智能体 populations 的可变性 necessitates 可扩展的决策机制。为此,我们提出了一种新框架:Sequential rollout with Sequential value estimation (SrSv)。该框架旨在捕获智能体之间的相互作用,并为合作 MARL 提供可扩展的解决方案。具体而言,SrSv 利用 Transformer 模型的自回归特性来处理可变 populations 的顺序动作推演。此外,为了捕获多个智能体之间策略分布和价值函数的相互作用,我们引入了一种创新的顺序价值估计方法,并将价值近似集成到注意力机制的顺序模型中。我们在三个基准测试中评估了 SrSv:Multi-Agent MuJoCo、StarCraft Multi-Agent Challenge 和 DubinsCars。实验结果表明,SrSv 在训练效率方面显著优于基线方法,同时不损害收敛性能。此外,当在具有 1,024 个智能体的大型 DubinsCar 系统中实现时,我们的框架超越了现有基准,凸显了 SrSv 的优异可扩展性。

关键词

引用

@article{arxiv.2503.01458,
  title  = {SrSv: Integrating Sequential Rollouts with Sequential Value Estimation for Multi-agent Reinforcement Learning},
  author = {Xu Wan and Chao Yang and Cheng Yang and Jie Song and Mingyang Sun},
  journal= {arXiv preprint arXiv:2503.01458},
  year   = {2025}
}