深度强化学习与搜索相结合用于不完美信息博弈
计算机科学与博弈论
2020-12-01 v2 人工智能
机器学习
摘要
在训练与测试时均结合深度强化学习与搜索是一种强有力的范式,已在单智能体场景与完美信息博弈中取得一系列成功,其典型代表为 AlphaZero。然而,此前此类算法无法应对不完美信息博弈。本文提出 ReBeL,一种用于自博弈强化学习与搜索的通用框架,可在任意两人零和博弈中证明收敛到纳什均衡。在较简单的完美信息博弈设定下,ReBeL 退化为类似于 AlphaZero 的算法。在两种不同不完美信息博弈中的结果表明 ReBeL 收敛到近似纳什均衡。我们还展示 ReBeL 在单挑无限注德州扑克中达到超人水平性能,同时所用领域知识远少于以往任何扑克 AI。
引用
@article{arxiv.2007.13544,
title = {Combining Deep Reinforcement Learning and Search for Imperfect-Information Games},
author = {Noam Brown and Anton Bakhtin and Adam Lerer and Qucheng Gong},
journal= {arXiv preprint arXiv:2007.13544},
year = {2020}
}