基于 KL 正则化的离线两人零和马尔可夫游戏
机器学习
2026-05-14 v1 计算机科学与博弈论
摘要
我们研究了在离线两人零和马尔可夫游戏中学习纳什均衡的问题。虽然现有方法通常依赖显式的乐观主义来解决分布迁移问题,但我们表明仅凭 KL 正则化即可稳定学习并保证收敛。我们首先引入正则化离线顺序均衡 (ROSE) 框架,在 \textit{单边可集中性} 下实现快速收敛率 ,优于标准在未正则化设置下的 收敛率。随后,我们提出序列离线自我玩镜像梯度 (SOS-MD) 方法,这是一种基于最小二乘值估计和迭代自我玩更新的实用无模型算法。我们证明了 SOS-MD 的最后迭代结果在自我玩迭代次数 的数量级 的优化误差下,达到了相同的 统计速率。
引用
@article{arxiv.2605.13025,
title = {Offline Two-Player Zero-Sum Markov Games with KL Regularization},
author = {Claire Chen and Yuheng Zhang and Xinyu Liu and Zixuan Xie and Shuze Daniel Liu and Nan Jiang},
journal= {arXiv preprint arXiv:2605.13025},
year = {2026}
}