中文

MF-OML:基于占用测度的在线均匀场强化学习

最优化与控制 2025-09-04 v2 人工智能 计算机科学与博弈论 机器学习 多智能体系统

摘要

多智能体游戏的强化学习近年来引起了广泛关注。然而,针对大规模游戏的纳什均衡求解挑战重大,已有的在保证多项式复杂度下工作要么聚焦于零和势游戏的变体,要么旨在求解(粗糙)相关均衡,要么需要模拟器,亦或依赖难以验证的假设。本文提出了 MF-OML(Mean-Field Occupation-Measure Learning),一种用于计算大规模序列对称游戏近似纳什均衡的在线均匀场强化学习算法。MF-OML 是首个在零和势游戏之外,能够以全多项式复杂度可证地求解纳什均衡的多智能体强化学习算法,其均匀场近似误差随玩家数 NN 无限增大而消失。当以累计偏离纳什均衡为评估标准时,算法在满足强 Lasry-Lions 单调性条件的游戏中实现高概率 O~(M3/4+N1/2M)\tilde{O}(M^{3/4}+N^{-1/2}M) 的 regret 界限,满足仅具 Lasry-Lions 单调性条件的游戏中实现 O~(M11/12+N1/6M)\tilde{O}(M^{11/12}+N^{-1/6}M) 的 regret 界限,其中 MM 为总回合数,NN 为游戏中的智能体数。作为副产品,我们还获得了第一个在可计算性意义上收敛的、用于计算大规模序列对称游戏近似纳什均衡的全局算法。

关键词

引用

@article{arxiv.2405.00282,
  title  = {MF-OML: Online Mean-Field Reinforcement Learning with Occupation Measures for Large Population Games},
  author = {Anran Hu and Junzi Zhang},
  journal= {arXiv preprint arXiv:2405.00282},
  year   = {2025}
}