IPPO学习的是博弈而非团队:异构智能体团队泛化性研究
机器人学
2026-03-10 v2
摘要
多智能体强化学习(MARL)通常部署在智能体通过与同质队友自对弈进行训练的场景中,常采用参数共享和单一策略架构。这引发了一个问题:自对弈PPO智能体在多大程度上学习到了基于底层博弈的通用协调策略,而非对训练伙伴行为的过拟合?本文利用异构多智能体挑战(HeMAC)环境研究这一问题,该环境包含具有互补能力的观测者智能体和无人机智能体。我们提出旋转策略训练(RPT),一种在训练过程中轮换不同学习算法的异构队友策略的方法,使智能体接触到更广泛的伙伴策略。当与保留的队友策略(DDQN)对弈时,我们发现RPT达到了与标准自对弈基线IPPO(所有智能体共享单一PPO策略训练)相似的性能。这一结果表明,在这种异构多智能体设置中,IPPO基线能够泛化到新颖的队友算法,尽管训练过程中并未经历队友多样性。这说明一个简单的IPPO基线可能具备多样化训练方案所设计达到的对新队友的泛化能力。
引用
@article{arxiv.2512.08877,
title = {IPPO Learns the Game, Not the Team: A Study on Generalization in Heterogeneous Agent Teams},
author = {Ryan LeRoy and Jack Kolb},
journal= {arXiv preprint arXiv:2512.08877},
year = {2026}
}
备注
4 pages, 3 figures, appendix