中文

双人零和马尔可夫博弈中可证明高效的策略优化

机器学习 2022-03-01 v2 计算机科学与博弈论 最优化与控制 机器学习

摘要

具有函数逼近的基于策略的方法被广泛用于求解具有大状态和/或动作空间的两人零和博弈。然而,如何为这类算法获得优化和统计保证仍不明确。我们提出了一种具有函数逼近的新策略优化算法,并证明在马尔可夫博弈和函数逼近类上的标准正则性条件下,我们的算法在多项式数量的样本和迭代内找到近最优策略。据我们所知,这是首个可证明高效的、求解两人零和马尔可夫博弈的具有函数逼近的策略优化算法。

关键词

引用

@article{arxiv.2102.08903,
  title  = {Provably Efficient Policy Optimization for Two-Player Zero-Sum Markov Games},
  author = {Yulai Zhao and Yuandong Tian and Jason D. Lee and Simon S. Du},
  journal= {arXiv preprint arXiv:2102.08903},
  year   = {2022}
}

备注

AISTATS 2022