Stackelberg 平均场博弈中的学习:非渐近分析
机器学习
2025-11-27 v2
摘要
我们研究 Stackelberg 平均场博弈(MFG)中的策略优化,这是一种用于建模单个领导者与无限大规模同质跟随者之间战略交互的分层框架。该目标可以表述为一个结构化的双层优化问题,其中领导者需要学习一个最大化其奖励的策略,同时预判跟随者的响应。现有的解决这些问题(及相关问题)的方法通常依赖于领导者和跟随者目标之间限制性独立性假设,由于嵌套循环算法结构而低效利用样本,并且缺乏有限时间收敛保证。为了解决这些局限性,我们提出了 AC-SMFG,一种在连续生成的马尔可夫样本上运行的单循环 Actor-Critic 算法。该算法在领导者、代表性跟随者和平均场之间交替进行(半)梯度更新,并且在实践中易于实现。我们建立了该算法在有限时间和有限样本下收敛到 Stackelberg 目标平稳点的性质。据我们所知,这是第一个具有非渐近收敛保证的 Stackelberg MFG 算法。我们的关键假设是"梯度对齐"条件,要求领导者的完整策略梯度可以由其部分分量来近似,从而放松了现有的领导者-跟随者独立性假设。在一系列成熟经济学环境中的仿真结果表明,AC-SMFG 在策略质量和收敛速度方面优于现有的多智能体和 MFG 学习基线。
引用
@article{arxiv.2509.15392,
title = {Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis},
author = {Sihan Zeng and Benjamin Patrick Evans and Sujay Bhatt and Leo Ardon and Sumitra Ganesh and Alec Koppel},
journal= {arXiv preprint arXiv:2509.15392},
year = {2025}
}
备注
Accepted at NeurIPS 2025