双人零和马尔可夫博弈中可证明高效的策略优化
机器学习
2022-03-01 v2 计算机科学与博弈论
最优化与控制
机器学习
摘要
具有函数逼近的基于策略的方法被广泛用于求解具有大状态和/或动作空间的两人零和博弈。然而,如何为这类算法获得优化和统计保证仍不明确。我们提出了一种具有函数逼近的新策略优化算法,并证明在马尔可夫博弈和函数逼近类上的标准正则性条件下,我们的算法在多项式数量的样本和迭代内找到近最优策略。据我们所知,这是首个可证明高效的、求解两人零和马尔可夫博弈的具有函数逼近的策略优化算法。
引用
@article{arxiv.2102.08903,
title = {Provably Efficient Policy Optimization for Two-Player Zero-Sum Markov Games},
author = {Yulai Zhao and Yuandong Tian and Jason D. Lee and Simon S. Du},
journal= {arXiv preprint arXiv:2102.08903},
year = {2022}
}
备注
AISTATS 2022