中文

离线均衡求解

人工智能 2023-02-09 v2 计算机科学与博弈论 机器学习

摘要

离线强化学习(offline RL)是一个新兴领域,由于能够从先前收集的数据集中学习策略,最近开始在各个应用域获得关注。Offline RL 被证明非常成功,为解决以往难以处理的现实世界问题铺平了道路,我们旨在将该范式推广到多人游戏设定。为此,我们引入离线均衡求解(OEF)问题,并使用若干已有方法在广泛游戏中构建多种类型的数据集。为解决 OEF 问题,我们设计了一个基于模型的框架,可直接将任何在线均衡求解算法以最小改动应用于 OEF 设定。三种最突出的当代在线均衡求解算法被适配到 OEF 语境,创建了三种基于模型的变体:OEF-PSRO 和 OEF-CFR,它们推广了广泛使用的 PSRO 和 Deep CFR 算法以计算纳什均衡(NEs);以及 OEF-JPSRO,它推广了 JPSRO 以计算(粗)相关均衡((C)CEs)。我们还将行为克隆策略与基于模型的策略结合以进一步提升性能,并提供解质量的理论保证。大量实验结果证明了我们的方法相对于 offline RL 算法的优越性,以及使用基于模型方法解决 OEF 问题的重要性。我们希望我们的工作能推动大规模均衡求解的研究。

关键词

引用

@article{arxiv.2207.05285,
  title  = {Offline Equilibrium Finding},
  author = {Shuxin Li and Xinrun Wang and Youzhi Zhang and Jakub Cerny and Pengdeng Li and Hau Chan and Bo An},
  journal= {arXiv preprint arXiv:2207.05285},
  year   = {2023}
}