Territory Paint Wars: 诊断和缓解竞争性多智能体 PPO 中的失效模式
机器学习
2026-04-08 v1
摘要
本文提出了 Territory Paint Wars,一个在 Unity 中实现的最小化竞争性多智能体强化学习环境,并利用它系统地研究了自博弈条件下近端策略优化(PPO)的失效模式。第一个智能体经过 84,000 轮训练后,在对称零和博弈中对抗均匀随机对手时仅达到 26.8% 的胜率。通过受控消融实验,我们识别出五种实现层面的失效模式——奖励尺度失衡、缺失终止信号、无效的长时序信用分配、未归一化的观测以及错误的胜负判定——每种模式对该设置中的失效都起到了关键作用。纠正这些问题后,我们发现了一种独特的涌现病理:竞争性过拟合,即协同适应的智能体在维持稳定自博弈性能的同时,泛化胜率从 73.5% 骤降至 21.6%。关键的是,这一失效无法通过标准自博弈指标检测到:两个智能体同等程度地协同适应,因此自博弈胜率在整个崩溃过程中始终接近 50%。我们提出了一种最小干预——对手混合,即在 20% 的训练轮次中用固定的均匀随机策略替代协同适应对手——该方法缓解了竞争性过拟合,并将泛化性能恢复到 77.1%(±12.6%,10 个随机种子),无需基于种群的训练或额外基础设施。我们开源 Territory Paint Wars,以提供研究竞争性 MARL 失效模式的可复现基准。
引用
@article{arxiv.2604.04983,
title = {Territory Paint Wars: Diagnosing and Mitigating Failure Modes in Competitive Multi-Agent PPO},
author = {Diyansha Singh},
journal= {arXiv preprint arXiv:2604.04983},
year = {2026}
}
备注
16 pages, 5 figures