快速策略迭代在马尔可夫博弈与鲁棒 MDP 中的收敛性
计算机科学与博弈论
2025-11-18 v2
摘要
马尔可夫博弈与鲁棒 MDP 是密切相关的模型,涉及计算 saddle point 策略。作为开发高效算法以应用于这些模型的长期努力中,Filar-Tolwinski(FT)算法展现出巨大的潜力。作为我们的第一项贡献,我们证明 FT 可能无法收敛到 saddle point,甚至可能无限循环,哪怕在小型博弈中亦如此。这一观察矛盾了原文中关于 FT 收敛到 saddle point 的证明。作为我们的第二项贡献,我们提出残差条件策略迭代(RCPI)。RCPI 基于 FT,但保证收敛到 saddle point。我们的Numerical结果表明,RCPI 相较于其他收敛算法快了几个数量级。
关键词
引用
@article{arxiv.2508.06661,
title = {Convergence of Fast Policy Iteration in Markov Games and Robust MDPs},
author = {Keith Badger and Jefferson Huang and Marek Petrik},
journal= {arXiv preprint arXiv:2508.06661},
year = {2025}
}