中文

释放深度反事实值网络的潜力

人工智能 2020-07-22 v1 机器学习

摘要

深度反事实值网络与持续求解相结合,提供了一种在不完美信息博弈中进行深度受限搜索的途径。然而,自其于 DeepStack 扑克 AI 中引入以来,深度反事实值网络并未得到广泛采用。在本文中,我们引入了对深度反事实值网络以及反事实后悔最小化的一些改进,并分析了每一处改动的影响。我们将这些改进结合以创建扑克 AI Supremus。我们表明,尽管 DeepStack 的重新实现在面对面较量中输给强基准智能体 Slumbot,但 Supremus 以极大优势成功击败 Slumbot,并且相较于局部最佳响应也取得了比 DeepStack 更低的可利用度。总之,这些结果表明,借助我们的关键改进,深度反事实值网络能够取得最先进的性能。

关键词

引用

@article{arxiv.2007.10442,
  title  = {Unlocking the Potential of Deep Counterfactual Value Networks},
  author = {Ryan Zarick and Bryan Pellegrino and Noam Brown and Caleb Banister},
  journal= {arXiv preprint arXiv:2007.10442},
  year   = {2020}
}

备注

11 pages, 6 figures