因果均场多智能体强化学习
人工智能
2025-02-21 v1 多智能体系统
摘要
在多智能体强化学习中,规模性仍是一个当前正在积极研究的挑战。一种名为均场强化学习(MFRL)的框架可以通过运用均场理论将众智能体问题转化为两智能体问题,从而缓解规模问题。然而,该框架缺乏识别非平稳环境下关键相互作用的能力。因果性质包含相互作用背后相对不变的机制,尽管环境是非平稳的。因此,我们提出了一种称为因果均场 Q 学习(CMFQ)的算法,以解决规模问题。CMFQ 在保持 MFRL 动作-状态空间压缩表示的基础上,对 agent 数量的变化更加稳健。首先,我们将 MFRL 决策过程中的因果性建模为结构因果模型(SCM)。随后,通过对 SCM 进行干预来量化每种相互作用的关键程度。进一步,我们设计了基于其因果效应的加权求和,用于表示 agent 行为信息的因果感知紧凑表示。我们在混合合作-竞争游戏和合作游戏中对 CMFQ 进行测试。结果表明,该方法在包含大量 agent 的环境下的训练以及包含远多于 agent 的环境下的测试中,具有出色的规模性能。
引用
@article{arxiv.2502.14200,
title = {Causal Mean Field Multi-Agent Reinforcement Learning},
author = {Hao Ma and Zhiqiang Pu and Yi Pan and Boyin Liu and Junlong Gao and Zhenyu Guo},
journal= {arXiv preprint arXiv:2502.14200},
year = {2025}
}