中文

零和马尔可夫博弈中通用函数逼近的初步探索

计算机科学与博弈论 2021-11-02 v3 机器学习 机器学习

摘要

本文考虑具有同步动作的双人零和有限时域马尔可夫博弈。研究聚焦于值函数或模型由通用函数类参数化这一挑战性设定。针对解耦(decoupled)与协调(coordinated)两种设定均开发了可证明高效的算法。在智能体控制单一参与方并与任意对手博弈的解耦设定下,我们提出一种无模型新算法。其样本复杂度由极小极大Eluder维(Minimax Eluder dimension)——马尔可夫博弈中函数类的一种新维数——所支配。作为特例,当奖励函数与转移核由 dd 维线性特征参数化时,该方法在后悔值(regret)上比最先进算法改进了 d\sqrt{d} 因子。在双方参与方均由智能体控制的协调设定下,我们提出了一种基于模型的算法与一种无模型算法。在基于模型的算法中,我们证明了样本复杂度可由Witness秩在马尔可夫博弈上的推广所界定。无模型算法具有 K\sqrt{K} 后悔值上界,其中 KK 为回合(episode)数。

关键词

引用

@article{arxiv.2107.14702,
  title  = {Towards General Function Approximation in Zero-Sum Markov Games},
  author = {Baihe Huang and Jason D. Lee and Zhaoran Wang and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2107.14702},
  year   = {2021}
}