中文

可扩展 MARL 中局部性的统一框架

机器学习 2026-02-20 v1 人工智能

摘要

可扩展的多智能体强化学习(MARL)面临维度灾难的挑战。常见解决方案是利用局部性,这取决于价值函数的指数衰减属性(EDP)。然而,既存的保证 EDP 的条件往往保守,因基于最坏情况、仅由环境决定的上界(如对动作的至多值)而忽略了策略本身的正则化作用。在本文中,我们证明局部性同样是一种\emph{策略依赖}的现象。我们的核心贡献是对策略诱导的相互依赖矩阵 HπH^\pi 的一种新颖分解,该分解将环境对状态(EsE^{\mathrm{s}})和动作(EaE^{\mathrm{a}})的敏感性与策略对状态(Π(π)\Pi(\pi))的敏感性分离。该分解表明,即使环境高度动作耦合,平滑策略(即小的 Π(π)\Pi(\pi))亦可诱导出局部性,暴露了一种根本的局部性-最优性权衡。我们利用该框架推导了一般的谱条件 ρ(Es+EaΠ(π))<1\rho(E^{\mathrm{s}}+E^{\mathrm{a}}\Pi(\pi)) < 1 以保证指数衰减,这一条件严格紧于先前基于范数的条件。最终,我们利用该理论分析了一种在谱半径直接关联的可证明局部分坐标策略改进框架。

关键词

引用

@article{arxiv.2602.16966,
  title  = {A Unified Framework for Locality in Scalable MARL},
  author = {Sourav Chakraborty and Amit Kiran Rege and Claire Monteleoni and Lijun Chen},
  journal= {arXiv preprint arXiv:2602.16966},
  year   = {2026}
}