以改进样本复杂度和末次迭代收敛学习零和线性二次博弈
系统与控制
2025-08-19 v4 计算机科学与博弈论
机器学习
系统与控制
摘要
零和线性二次(LQ)博弈在最优控制中具基础性,并可用于(i)作为风险敏感或鲁棒控制的动态博弈表述,以及(ii)作为具两竞争智能体连续状态—控制空间的多智能体强化学习基准设定。与充分研究的单智能体线性二次调节器问题相反,零和 LQ 博弈需解决缺乏强制性目标函数的困难非凸—非凹极小极大问题。近来,Zhang 等人证明有限时域零和 LQ 博弈的 -纳什均衡(NE)可通过嵌套无模型自然策略梯度(NPG)算法以 poly 样本复杂度学习。本工作中,我们提出更简单的嵌套零阶(ZO)算法,将样本复杂度改进数个数量级并保证末次迭代收敛。我们的主要结果有两点:(i)在确定性设定下,我们建立寻求零和 LQ 博弈 NE 的嵌套算法首个全局末次迭代线性收敛结果;(ii)在无模型设定下,我们利用单点 ZO 估计器建立 样本复杂度。对于末次迭代收敛结果,我们的分析利用隐式正则化(IR)性质及原函数的新的梯度支配条件。我们在样本复杂度上的关键改进依赖于更省样本的嵌套算法设计,以及利用有限时域设定所赋予结构对 ZO 自然梯度估计误差的更精细控制。
引用
@article{arxiv.2309.04272,
title = {Learning Zero-Sum Linear Quadratic Games with Improved Sample Complexity and Last-Iterate Convergence},
author = {Jiduan Wu and Anas Barakat and Ilyas Fatkhullin and Niao He},
journal= {arXiv preprint arXiv:2309.04272},
year = {2025}
}