中文

零和不完全信息博弈中深度受限求解的值函数

人工智能 2022-03-25 v5 计算机科学与博弈论

摘要

我们给出了深度受限博弈的形式化定义,并提供了底层概念的通俗且严谨的解释,这两者在先前的不完全信息博弈中均是缺失的。该定义适用于任意扩展式博弈,且不依赖于任何特定的博弈求解算法。此外,该框架统一并显著扩展了扩展式博弈和多智能体强化学习中先前存在的三种深度受限求解方法,而此前人们并不知道它们是兼容的。这些深度受限博弈的一个关键要素是值函数。聚焦于两人零和不完全信息博弈,我们展示了如何获得最优值函数,并证明公开信息为计算它们提供了必要且充分的上下文。我们提供了领域的与领域无关的编码,使得即便简单的前馈神经网络也能逼近值函数,并进而能够泛化到博弈中未见过部分。我们利用所得值网络实现了反事实遗憾最小化的深度受限版本。在三个不同领域中,我们表明该算法的可利用性大致线性依赖于值网络的质量,并且训练一个使深度受限CFR性能与可访问完整博弈的CFR一样好的值网络并不困难。

关键词

引用

@article{arxiv.1906.06412,
  title  = {Value Functions for Depth-Limited Solving in Zero-Sum Imperfect-Information Games},
  author = {Vojtěch Kovařík and Dominik Seitz and Viliam Lisý and Jan Rudolf and Shuo Sun and Karel Ha},
  journal= {arXiv preprint arXiv:1906.06412},
  year   = {2022}
}

备注

The first two authors contributed equally