基于稳健价值分解的分布式鲁棒合作多智能体强化学习
人工智能
2026-02-13 v1 多智能体系统
摘要
合作多智能体强化学习 (MARL) 通常采用集中训练、分布执行,其中价值分解方法遵循individual-global-maximum (IGM)原则,以确保分布式贪心动作能够恢复团队最优联合动作。然而,由于来自仿真到现实差距、模型不匹配和系统噪声引起的环境不确定性,该方法在现实世界中的可靠性仍不稳定。我们通过引入分布式鲁棒IGM (DrIGM),即要求每个智能体的鲁棒贪心动作与鲁棒团队最优联合动作保持一致来弥合这一差距。我们表明,DrIGM适用于一种新定义的鲁棒individual action value,该定义兼容分布式贪心执行,并为整个系统提供可证明的鲁棒性保证。建立在此基础上,我们派生出DrIGM兼容的现有价值分解架构(如VDN/QMIX/QTRAN)的鲁棒变体(i)在鲁棒Q目标上进行训练,(ii)保持可扩展性,(iii)无需针对每个智能体进行专门的奖励调整即可无缝集成到现有代码库中。实验在高保真SustainGym模拟器和StarCraft游戏环境上表明,我们的方法在不同分布的性能上 consistently 获得改进。代码和数据可在 https://github.com/crqu/robust-coMARL 获取。
引用
@article{arxiv.2602.11437,
title = {Distributionally Robust Cooperative Multi-Agent Reinforcement Learning via Robust Value Factorization},
author = {Chengrui Qu and Christopher Yeh and Kishan Panaganti and Eric Mazumdar and Adam Wierman},
journal= {arXiv preprint arXiv:2602.11437},
year = {2026}
}
备注
ICLR 2026