零和马尔可夫博弈中通用函数逼近的初步探索
计算机科学与博弈论
2021-11-02 v3 机器学习
机器学习
摘要
本文考虑具有同步动作的双人零和有限时域马尔可夫博弈。研究聚焦于值函数或模型由通用函数类参数化这一挑战性设定。针对解耦(decoupled)与协调(coordinated)两种设定均开发了可证明高效的算法。在智能体控制单一参与方并与任意对手博弈的解耦设定下,我们提出一种无模型新算法。其样本复杂度由极小极大Eluder维(Minimax Eluder dimension)——马尔可夫博弈中函数类的一种新维数——所支配。作为特例,当奖励函数与转移核由 维线性特征参数化时,该方法在后悔值(regret)上比最先进算法改进了 因子。在双方参与方均由智能体控制的协调设定下,我们提出了一种基于模型的算法与一种无模型算法。在基于模型的算法中,我们证明了样本复杂度可由Witness秩在马尔可夫博弈上的推广所界定。无模型算法具有 后悔值上界,其中 为回合(episode)数。
引用
@article{arxiv.2107.14702,
title = {Towards General Function Approximation in Zero-Sum Markov Games},
author = {Baihe Huang and Jason D. Lee and Zhaoran Wang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2107.14702},
year = {2021}
}