完全去中心化的合作多智能体强化学习是一种情境建模问题
机器学习
2026-05-12 v2
摘要
本文研究完全去中心化的合作多智能体强化学习问题,其中每个智能体仅观察状态、其本地动作以及共享奖励。由于无法访问其他智能体的动作,常常会导致价值函数更新期间出现非平稳性,以及价值函数估计期间出现相对过度概括,阻碍有效的协作策略学习。然而,现有工作由于无法在完全去中心化设置下建模其他智能体的联合策略,未能同时解决上述两个问题。为克服这一局限,本文提出了一种新方法,称为动力学感知情境(Dynamics-Aware Context, DAC),该方法将任务形式化为每个智能体所感知的情境马尔可夫决策过程(Contextual Markov Decision Process),并通过动力学感知情境建模来解决非平稳性和相对过度概括问题。具体而言,DAC将每个智能体的非平稳本地任务动力学归因于在未观测情境之间的切换,每个情境对应于不同的联合策略。然后,DAC使用潜在变量来模型化步骤级的动力学分布,并将其称为情境。对于每个智能体,DAC引入基于情境的值函数,以解决价值函数更新期间的非平稳性问题。对于价值函数估计,DAC推导出乐观的边际值,以促进协作动作的选择,从而解决相对过度概括问题。实验方面,我们在各种合作任务上评估了DAC(包括矩阵游戏、捕食者与猎物以及SMAC),其优于多个基线的优异性能验证了其有效性。
引用
@article{arxiv.2509.15519,
title = {Fully Decentralized Cooperative Multi-Agent Reinforcement Learning is A Context Modeling Problem},
author = {Chao Li and Bingkun Bao and Yang Gao},
journal= {arXiv preprint arXiv:2509.15519},
year = {2026}
}