改进异构多智能体强化学习中单调优化:基于最优边际确定性策略梯度
人工智能
2025-07-15 v1 多智能体系统
摘要
在异构多智能体强化学习 (MARL) 中,实现单调性提升是提升性能的关键。HAPPO算法通过引入顺序更新方案提出了可行方案,要求独立学习且不共享参数 (No Parameter-sharing, NoPS)。然而,异构MARL通常需要基于智能体分组的分部分份参数共享 (Partial Parameter-sharing, ParPS) 以实现高效的协作性能。我们的实验证明,直接将ParPS与顺序更新方案结合会导致策略更新基线漂移问题,从而无法实现提升。为解决单调性提升与ParPS之间的冲突,我们提出了最优边际确定性策略梯度 (Optimal Marginal Deterministic Policy Gradient, OMDPG) 算法。首先,用从Q函数派生的最优边际Q函数 替换顺序计算的 ,从而维持MAAD的单调性提升,同时通过最优联合动作序列取代顺序策略比率计算消除冲突。其次,我们引入广义Q评判家 (Generalized Q Critic, GQC) 作为评判函数,采用悲观不确定性约束损失优化不同的Q值估计,为OMQ计算提供所需的Q值并为演员更新提供稳定的基线。最后,我们实现了集中式评判家分组演员 (Centralized Critic Grouped Actor, CCGA) 架构,同时实现局部策略网络中的ParPS和准确的全局Q函数计算。在SMAC和MAMuJoCo环境中的实验结果表明,OMDPG在各种最新MARL基线中均表现优异。
引用
@article{arxiv.2507.09989,
title = {Improving monotonic optimization in heterogeneous multi-agent reinforcement learning with optimal marginal deterministic policy gradient},
author = {Xiaoyang Yu and Youfang Lin and Shuo Wang and Sheng Han},
journal= {arXiv preprint arXiv:2507.09989},
year = {2025}
}