基于连续时间价值迭代的多智能体强化学习
机器学习
2026-02-20 v3 多智能体系统
摘要
现有的强化学习(RL)方法在面对需要高频或不规则时间间隔交互的复杂动态系统时常常力不从众。连续时间强化学习(CTRL)通过用鬶--雅可比--班恩方程(HJB方程)的黏性解形式定义的微分价值函数来取代离散时间的贝尔曼递归,已成为一种有前景的替代方案。尽管如此,CTRL的实际应用仍主要局限于单智能体领域。这种限制源于两个关键挑战:(i) 传统的HJB方程求解方法受维数灾难(CoD)的困扰,导致在高维系统中难以求解;以及(ii) 即便采用基于HJB的学习方法,对多智能体环境中集中式价值函数的精确逼近仍然困难,这进而会使策略训练不稳定。本文提出了CT-MARL框架,利用基于物理的神经网络(PINNs)对HJB-based价值函数进行大规模逼近。为确保价值函数满足其微分结构,我们引入了价值梯度迭代(VGI)模块,通过沿轨迹迭代细化价值梯度,从而提高梯度保真度,进而获得更准确的价值估计并提升策略学习效果。我们使用连续时间版本的标准基准进行评估,包括多智能体粒子环境(MPE)和多智能体MuJoCo。实验结果表明,我们的方法在持续优于现有的连续时间RL基线方法,并能扩展至复杂的多智能体动态系统。
引用
@article{arxiv.2509.09135,
title = {Continuous-Time Value Iteration for Multi-Agent Reinforcement Learning},
author = {Xuefeng Wang and Lei Zhang and Henglin Pu and Ahmed H. Qureshi and Husheng Li},
journal= {arXiv preprint arXiv:2509.09135},
year = {2026}
}
备注
Accepted at ICLR 2026. 21 pages, 13 figures