中文

回合制随机博弈的极小极大样本复杂度

机器学习 2020-12-01 v1 计算机科学与博弈论 机器学习

摘要

多智能体强化学习的经验性成功令人鼓舞,但其理论保证却鲜有揭示。本工作中,我们证明插件求解器方法——可能是最自然的强化学习算法——在回合制随机博弈(TBSG)中达到了极小极大样本复杂度。具体地,我们在一个经验TBSG中进行规划,利用一个允许从任意状态-动作对采样的“模拟器”。我们表明经验纳什均衡策略是真TBSG中的近似纳什均衡策略,并给出了依赖于问题和独立于问题的界。我们发展了吸收型TBSG和奖励扰动技术来处理复杂的统计依赖性。核心思想是在TBSG中人为引入次优性间隙,从而纳什均衡策略落在一个有限集合中。

关键词

引用

@article{arxiv.2011.14267,
  title  = {Minimax Sample Complexity for Turn-based Stochastic Game},
  author = {Qiwen Cui and Lin F. Yang},
  journal= {arXiv preprint arXiv:2011.14267},
  year   = {2020}
}

备注

15 pages