中文

基于Q学习的零和回合游戏:有限计算与安全保证

系统与控制 2025-09-18 v1 计算机科学与博弈论 系统与控制

摘要

本文针对零和“回合”游戏(turn games),即在每个状态下只有一位玩家可以做出决策。我们表明,针对回合游戏的纯saddle-point状态反馈策略,可从单个价值函数或Q函数的动态规划固定点方程中构造。这种固定点可通过合适形式的Q学习来构建。对于折扣成本,本文可使用经典技术建立Q学习的收敛性。对于非折扣成本,我们提供了适用于有限时间确定性游戏的收敛结果,这用于说明我们的发现。对于复杂游戏,Q学习迭代必须在未遍历完整状态空间前终止,这可能导致无法保证最终Q函数所暗示的安全水平。为缓解此问题,我们提出了一种“对手信息化”探索策略用于选择Q学习样本。这种形式的探索可保证最终Q函数提供的安全水平至少在给定的一组策略下成立。针对一种多代理游戏Atlatl的数值演示表明了这些方法的有效性。

关键词

引用

@article{arxiv.2509.13585,
  title  = {Zero-sum turn games using Q-learning: finite computation with security guarantees},
  author = {Sean Anderson and Chris Darken and João Hespanha},
  journal= {arXiv preprint arXiv:2509.13585},
  year   = {2025}
}

备注

8 pages