中文

不完美信息扩展式博弈的近最优学习

机器学习 2023-04-04 v3 人工智能 计算机科学与博弈论 机器学习

摘要

本文解决了从赌博机反馈中学习不完美信息扩展式博弈的近最优算法设计的开放问题。我们提出首个仅需 O~((XA+YB)/ε2)\widetilde{\mathcal{O}}((XA+YB)/\varepsilon^2) 次对局即可在两人零和博弈中找到 ε\varepsilon-近似纳什均衡的算法系列,其中 X,YX,Y 为信息集数目,A,BA,B 为两玩家的动作数目。这相比已知最优样本复杂度 O~((X2A+Y2B)/ε2)\widetilde{\mathcal{O}}((X^2A+Y^2B)/\varepsilon^2) 改进了 O~(max{X,Y})\widetilde{\mathcal{O}}(\max\{X, Y\}) 倍,且在对数因子内匹配信息论下界。我们通过两种新算法达到该样本复杂度:平衡在线镜像下降与平衡反事实遗憾最小化。两种算法均依赖于将\emph{平衡探索策略}整合进其经典对应物的新方法。我们还将结果扩展至多人一般和博弈中粗相关均衡的学习。

关键词

引用

@article{arxiv.2202.01752,
  title  = {Near-Optimal Learning of Extensive-Form Games with Imperfect Information},
  author = {Yu Bai and Chi Jin and Song Mei and Tiancheng Yu},
  journal= {arXiv preprint arXiv:2202.01752},
  year   = {2023}
}

备注

Updated V3 to be consistent with ICML 2022 camera-ready version, with an additional analysis of CFR in full-feedback setting in Appendix F