中文

利用均值场相互作用和在线对手建模学习大规模竞争团队行为

多智能体系统 2026-02-16 v3

摘要

虽然多智能体强化学习 (MARL) 在协作和竞争任务中均被证明有效,但现有算法往往难以扩展到大规模智能体群体。最近的均值场 (MF) 理论进展通过将群体互动近似为连续体的方式,提供了可扩展的解决方案,但大多数现有框架仅专注于完全合作或纯粹竞争环境。为弥合这一差距,我们引入了 MF-MAPPO,这是一种针对零和团队游戏的均值场 PPO 扩展,该方法集成了团队内部的合作与团队间的竞争。MF-MAPPO 使用每个团队共享的 actor 和最小化信息的 critic,并直接在有限群体模拟器上进行训练,从而实现对数千智能体的真实场景部署。我们进一步展示了 MF-MAPPO 通过一种简单的梯度正则化训练方案自然扩展到部分可观测环境。我们的评估利用了大规模基准场景,采用我们自建的 MF 团队游戏测试平台 (MFEnv),包括攻防战场任务以及 admitting 分析解的基于人口的石头剪子变体游戏。对于这些基准,MF-MAPPO 在现有方法上取得了优异表现,展现出复杂且异质的行为,证明了在大规模场景下将均值场理论与 MARL 技术相结合的有效性。

关键词

引用

@article{arxiv.2504.21164,
  title  = {Learning Large-Scale Competitive Team Behaviors with Mean-Field Interactions and Online Opponent Modeling},
  author = {Bhavini Jeloka and Yue Guan and Panagiotis Tsiotras},
  journal= {arXiv preprint arXiv:2504.21164},
  year   = {2026}
}