中文

因果均场多智能体强化学习

人工智能 2025-02-21 v1 多智能体系统

摘要

在多智能体强化学习中,规模性仍是一个当前正在积极研究的挑战。一种名为均场强化学习(MFRL)的框架可以通过运用均场理论将众智能体问题转化为两智能体问题,从而缓解规模问题。然而,该框架缺乏识别非平稳环境下关键相互作用的能力。因果性质包含相互作用背后相对不变的机制,尽管环境是非平稳的。因此,我们提出了一种称为因果均场 Q 学习(CMFQ)的算法,以解决规模问题。CMFQ 在保持 MFRL 动作-状态空间压缩表示的基础上,对 agent 数量的变化更加稳健。首先,我们将 MFRL 决策过程中的因果性建模为结构因果模型(SCM)。随后,通过对 SCM 进行干预来量化每种相互作用的关键程度。进一步,我们设计了基于其因果效应的加权求和,用于表示 agent 行为信息的因果感知紧凑表示。我们在混合合作-竞争游戏和合作游戏中对 CMFQ 进行测试。结果表明,该方法在包含大量 agent 的环境下的训练以及包含远多于 agent 的环境下的测试中,具有出色的规模性能。

关键词

引用

@article{arxiv.2502.14200,
  title  = {Causal Mean Field Multi-Agent Reinforcement Learning},
  author = {Hao Ma and Zhiqiang Pu and Yi Pan and Boyin Liu and Junlong Gao and Zhenyu Guo},
  journal= {arXiv preprint arXiv:2502.14200},
  year   = {2025}
}