悲观极小极大值迭代:基于离线数据集的可证明高效均衡学习
机器学习
2023-01-02 v3 计算机科学与博弈论
机器学习
摘要
我们研究离线设定下的情节式双人零和马尔可夫博弈(MGs),其目标基于先验收集的数据集寻找近似纳什均衡(NE)策略对。当数据集未对所有策略对具有一致覆盖时,寻找近似 NE 涉及三方面的挑战:(i) 行为策略与最优策略之间的分布偏移,(ii) 处理大状态空间的函数逼近,以及 (iii) 用于均衡求解的极小极大优化。我们提出一种基于悲观主义的算法,称为悲观极小极大值迭代(PMVI),其通过对两名玩家的价值函数构造悲观估计来克服分布偏移,并基于这两个价值函数求解 NE 输出策略对。此外,我们建立了次优性的数据依赖上界,该上界在无数据集一致覆盖假设下仍可恢复次线性速率。我们还证明了信息论下界,表明上界中的数据依赖项是本质的。我们的理论结果还凸显了“相对不确定性”这一概念,其刻画了离线 MGs 中实现样本效率的必要充分条件。据我们所知,我们给出了带函数逼近的离线 MGs 的首个近极小极大最优结果。
引用
@article{arxiv.2202.07511,
title = {Pessimistic Minimax Value Iteration: Provably Efficient Equilibrium Learning from Offline Datasets},
author = {Han Zhong and Wei Xiong and Jiyuan Tan and Liwei Wang and Tong Zhang and Zhaoran Wang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2202.07511},
year = {2023}
}