通用和 Stackelberg 游戏中 Q 值迭代的有限时间分析
机器学习
2026-04-07 v1 系统与控制
系统与控制
摘要
强化学习在单智能体环境中在经验和理论上都取得了成功,但将这些结果拓展到一般和的多智能体强化学习仍具有挑战性。本文从控制理论视角研究 Stackelberg Q 值迭代在两个玩家一般和马尔可夫游戏中的收敛性。我们引入一种针对 Stackelberg 环境的放松策略条件,将学习动力学建模为开关系统。通过构建上、下比较系统,建立 Q 函数的有限时间误差界并刻画其收敛性质。我们的结果提供了对 Stackelberg 学习的一种新型控制理论视角。此外, 到目前为止我们所知, 本文是对一般和马尔可夫游戏中 Stackelberg 互动下的 Q 值迭代提供首个有限时间收敛保证。
引用
@article{arxiv.2604.04394,
title = {Finite-Time Analysis of Q-Value Iteration for General-Sum Stackelberg Games},
author = {Narim Jeong and Donghwan Lee},
journal= {arXiv preprint arXiv:2604.04394},
year = {2026}
}
备注
8 pages