中文

将 MARL 联结至 SARL:基于潜在共识的顺序无关多智能体 Transformer

机器学习 2026-04-16 v1 人工智能 多智能体系统

摘要

合作式多智能体强化学习 (MARL) 广泛用于通过分解集中控制问题为多个相互作用智能体来处理大型联合观察与动作空间。然而,这种分解常引入额外挑战,包括非平稳性、训练不稳定、协调弱且理论保证有限。本文提出了共识多智能体 Transformer (CMAT),一个将合作 MARL 联结至层次化单智能体强化学习 (SARL) 框架的中心化方案。CMAT 将所有智能体视为统一实体,采用 Transformer 编码器处理大型联合观察空间。为处理广泛的联合动作空间,我们引入层次化决策机制,Transformer 解码器自回归生成高层次共识向量,模拟智能体在潜在空间中就战略达成一致的过程。基于此共识,所有智能体同时生成动作,实现顺序无关的联合决策,避免了常规多智能体 Transformer (MAT) 对动作生成顺序的敏感性。这种分解使联合策略可使用单智能体 PPO 进行优化,同时保持通过潜在共识的表达性协调。为评估所提方法,我们在 StarCraft II、Multi-Agent MuJoCo 和 Google Research Football 等基准任务上进行实验。结果表明,CMAT 在最新集中式解决方案、顺序 MARL 方法以及常规 MARL 框架中均取得优异性能。本论文代码已公开:https://github.com/RS2002/CMAT

关键词

引用

@article{arxiv.2604.13472,
  title  = {Bridging MARL to SARL: An Order-Independent Multi-Agent Transformer via Latent Consensus},
  author = {Zijian Zhao and Jing Gao and Sen Li},
  journal= {arXiv preprint arXiv:2604.13472},
  year   = {2026}
}