中文

基于单调非线性评论家分解的多智能体交叉熵方法

机器学习 2025-11-27 v2 多智能体系统

摘要

合作多智能体强化学习(MARL)通常采用集中训练、分散执行(CTDE)策略,其中集中评论家利用全局信息指导分散的演员。然而,当一个智能体的次优行为损害其他智能体的学习时,便会出现集中-分散不匹配(CDM)。先前方法通过价值分解来缓解 CDM,但线性分解允许每个智能体的梯度,代价是表达受限;而非线性分解提高了表示,但需要集中梯度,重新引入 CDM。为克服这一权衡,我们提出多智能体交叉熵方法(MCEM),结合单调非线性评论家分解(NCD)。MCEM 通过增加高价值联合动作的概率来更新策略,从而排除次优行为。为提高样本效率,我们扩展了基于修改 k 步返回和 Retrace 的离线策略学习。分析和实验表明,MCEM 在连续和离散动作基准上均优于最先进的方法。

关键词

引用

@article{arxiv.2511.18671,
  title  = {Multi-Agent Cross-Entropy Method with Monotonic Nonlinear Critic Decomposition},
  author = {Yan Wang and Ke Deng and Yongli Ren},
  journal= {arXiv preprint arXiv:2511.18671},
  year   = {2025}
}