回合制随机博弈的极小极大样本复杂度
机器学习
2020-12-01 v1 计算机科学与博弈论
机器学习
摘要
多智能体强化学习的经验性成功令人鼓舞,但其理论保证却鲜有揭示。本工作中,我们证明插件求解器方法——可能是最自然的强化学习算法——在回合制随机博弈(TBSG)中达到了极小极大样本复杂度。具体地,我们在一个经验TBSG中进行规划,利用一个允许从任意状态-动作对采样的“模拟器”。我们表明经验纳什均衡策略是真TBSG中的近似纳什均衡策略,并给出了依赖于问题和独立于问题的界。我们发展了吸收型TBSG和奖励扰动技术来处理复杂的统计依赖性。核心思想是在TBSG中人为引入次优性间隙,从而纳什均衡策略落在一个有限集合中。
引用
@article{arxiv.2011.14267,
title = {Minimax Sample Complexity for Turn-based Stochastic Game},
author = {Qiwen Cui and Lin F. Yang},
journal= {arXiv preprint arXiv:2011.14267},
year = {2020}
}
备注
15 pages