中文

基于核的协作博弈论多智能体策略梯度信用分配

多智能体系统 2026-03-11 v3 人工智能 计算机科学与博弈论 机器学习

摘要

本文聚焦于协作多智能体强化学习(MARL)中的信用分配问题。在智能体之间共享全局优势通常会导致策略优化不足,因为它未能捕捉不同智能体的联盟贡献。在这项工作中,我们从联盟视角重新审视策略更新过程,并提出了CORA,一种由协作博弈论核分配引导的优势分配方法。通过评估不同联盟的边际贡献并结合裁剪双Q学习以减轻过估计偏差,CORA估计了联盟级别的优势。核公式强制对分配的信用施加联盟级下界,使得具有更高优势的联盟为其参与智能体获得更强的总激励,从而将全局优势归因于不同的联盟策略,并促进协调的最优行为。为了降低计算开销,我们采用随机联盟采样来高效近似核分配。在矩阵博弈、微分博弈和多智能体协作基准上的实验表明,我们的方法优于基线方法。这些发现强调了联盟级信用分配和协作博弈对于推进多智能体学习的重要性。

关键词

引用

@article{arxiv.2506.04265,
  title  = {Cooperative Game-Theoretic Credit Assignment for Multi-Agent Policy Gradients via the Core},
  author = {Mengda Ji and Genjiu Xu and Keke Jia and Zekun Duan and Yong Qiu and Jianjun Ge and Mingqiang Li},
  journal= {arXiv preprint arXiv:2506.04265},
  year   = {2026}
}