协同多智能体强化学习的 Wasserstein-Barycenter 共识
系统与控制
2025-06-19 v2 系统与控制
摘要
协同多智能体强化学习(MARL)需要合理的机制来对齐异构策略,同时保留专门化行为的能力。我们提出了一种新的共识框架,将团队策略定义为智能体联合状态-动作访问测度的熵正则化 p-Wasserstein 重心。通过在每个智能体的策略目标上增加与其重心之间的 Sinkhorn 散度成正比的软惩罚,所提方法鼓励一致的群体行为,而不强制进行严格的参数共享。我们推导了一种在 Sinkhorn-重心计算与策略梯度更新之间交替的算法,并在标准 Lipschitz 和紧致性假设下证明了最大策略对间差异以几何速率收缩。在合作导航案例研究的实证评估表明,我们的 OT-重心共识方法在收敛速度和最终协调成功率方面优于独立学习器基线。
引用
@article{arxiv.2506.12497,
title = {Wasserstein-Barycenter Consensus for Cooperative Multi-Agent Reinforcement Learning},
author = {Ali Baheri},
journal= {arXiv preprint arXiv:2506.12497},
year = {2025}
}