中文

基于 KL 正则化的离线两人零和马尔可夫游戏

机器学习 2026-05-14 v1 计算机科学与博弈论

摘要

我们研究了在离线两人零和马尔可夫游戏中学习纳什均衡的问题。虽然现有方法通常依赖显式的乐观主义来解决分布迁移问题,但我们表明仅凭 KL 正则化即可稳定学习并保证收敛。我们首先引入正则化离线顺序均衡 (ROSE) 框架,在 \textit{单边可集中性} 下实现快速收敛率 O~(1/n)\widetilde{\mathcal{O}}(1/n),优于标准在未正则化设置下的 O~(1/n)\widetilde{\mathcal{O}}(1/\sqrt{n}) 收敛率。随后,我们提出序列离线自我玩镜像梯度 (SOS-MD) 方法,这是一种基于最小二乘值估计和迭代自我玩更新的实用无模型算法。我们证明了 SOS-MD 的最后迭代结果在自我玩迭代次数 TT 的数量级 O~(1/T)\widetilde{\mathcal{O}}(1/\sqrt{T}) 的优化误差下,达到了相同的 O~(1/n)\widetilde{\mathcal{O}}(1/n) 统计速率。

关键词

引用

@article{arxiv.2605.13025,
  title  = {Offline Two-Player Zero-Sum Markov Games with KL Regularization},
  author = {Claire Chen and Yuheng Zhang and Xinyu Liu and Zixuan Xie and Shuze Daniel Liu and Nan Jiang},
  journal= {arXiv preprint arXiv:2605.13025},
  year   = {2026}
}