中文

ME-IGM:最大熵多智能体强化学习中的个体-全局-最大

机器学习 2026-02-04 v4

摘要

多智能体信用分配是合作式多智能体强化学习(MARL)中的一个基本挑战,其中智能体团队从共享的奖励信号中学习。个体-全局-最大(IGM)条件是用于多智能体信用分配的一个广泛使用的原则,它要求由个体Q函数确定的联合动作能最大化全局Q值。同时,最大熵原理已被用于增强MARL中的探索。然而,我们指出现有最大熵MARL方法中的一个关键局限性:局部策略与最大化全局Q值的联合策略之间出现了错位,导致违反IGM条件。为了解决这种错位,我们提出了一种保序变换。在此基础上,我们引入了ME-IGM,这是一种新颖的最大熵MARL算法,它与任何满足IGM条件的信用分配机制兼容,同时享受最大熵探索带来的益处。我们在非单调矩阵博弈中实证评估了ME-IGM的两个变体:ME-QMIX和ME-QPLEX,并在SMAC-v2和Overcooked的17个场景中展示了它们的最优性能。

关键词

引用

@article{arxiv.2406.13930,
  title  = {ME-IGM: Individual-Global-Max in Maximum Entropy Multi-Agent Reinforcement Learning},
  author = {Wen-Tse Chen and Yuxuan Li and Shiyu Huang and Jiayu Chen and Jeff Schneider},
  journal= {arXiv preprint arXiv:2406.13930},
  year   = {2026}
}

备注

Published in the Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)