中文

用于稳定多智能体策略学习的度量梯度投影

机器学习 2026-05-20 v1 人工智能

摘要

一般和博弈多智能体学习通常受控于一个叠加更新场,其中每个智能体的策略更新改变了其他智能体面临的优化景观。这种耦合可将集体改进的可积分量与循环交互动态纠缠在一起,导致多智能体学习缓慢或不稳定。现有方法(如正则化、信用分配和共识方法)通过局部或算法修改来稳定 MARL;HPML 通过将联合更新场投影到度量梯度分量上来补充它们。我们引入了 \textbf{HPML}(\textbf{H}odge-\textbf{P}rojected \textbf{M}ulti-agent \textbf{L}earning,Hodge 投影多智能体学习),它将多智能体系统的联合更新场视为向量场 L2L^2 空间的一个元素,并计算到最近度量梯度势流的 Hodge 型投影。HPML 遵循投影分量作为更新方向,在所选度量和采样测度下产生最近的度量梯度场。该投影是变分定义的,由 Poisson 型方程表征,并通过基于图和摊销神经实现从样本中恢复投影方向。我们表明,投影动态允许 Lyapunov 势,并在显式加性非势项下产生均衡间隙界。受控实验验证了该几何机制,CTDE 基准表明,当 HPML 作为 MARL 流水线中的即插即用投影层时,稳定性和标准化回报得到提升。

关键词

引用

@article{arxiv.2605.18809,
  title  = {Metric-Gradient Projection for Stable Multi-Agent Policy Learning},
  author = {Zuyuan Zhang and Sizhe Tang and Mahdi Imani and Tian Lan},
  journal= {arXiv preprint arXiv:2605.18809},
  year   = {2026}
}