中文

通用和 Stackelberg 游戏中 Q 值迭代的有限时间分析

机器学习 2026-04-07 v1 系统与控制 系统与控制

摘要

强化学习在单智能体环境中在经验和理论上都取得了成功,但将这些结果拓展到一般和的多智能体强化学习仍具有挑战性。本文从控制理论视角研究 Stackelberg Q 值迭代在两个玩家一般和马尔可夫游戏中的收敛性。我们引入一种针对 Stackelberg 环境的放松策略条件,将学习动力学建模为开关系统。通过构建上、下比较系统,建立 Q 函数的有限时间误差界并刻画其收敛性质。我们的结果提供了对 Stackelberg 学习的一种新型控制理论视角。此外, 到目前为止我们所知, 本文是对一般和马尔可夫游戏中 Stackelberg 互动下的 Q 值迭代提供首个有限时间收敛保证。

关键词

引用

@article{arxiv.2604.04394,
  title  = {Finite-Time Analysis of Q-Value Iteration for General-Sum Stackelberg Games},
  author = {Narim Jeong and Donghwan Lee},
  journal= {arXiv preprint arXiv:2604.04394},
  year   = {2026}
}

备注

8 pages