中文

基于后悔剪枝的不完全信息博弈中的降维与加速收敛

计算机科学与博弈论 2016-09-13 v1 人工智能

摘要

反事实后悔最小化(CFR)是求解零和不完全信息博弈最流行的迭代算法。后悔剪枝(RBP)是一种改进,它允许暂时剪枝表现不佳的动作,从而加速CFR。我们引入了Total RBP,这是一种新的RBP形式,它随着动作被剪枝而降低了CFR的空间需求。我们证明了在零和博弈中,它能渐近地剪枝任何不属于对某个 Nash 均衡的最佳响应的动作。这带来了可证明的更快收敛速度和更低的空间需求。实验表明,Total RBP 使空间减少了一个数量级,且减少因子随博弈规模的增大而增加。

关键词

引用

@article{arxiv.1609.03234,
  title  = {Reduced Space and Faster Convergence in Imperfect-Information Games via Regret-Based Pruning},
  author = {Noam Brown and Tuomas Sandholm},
  journal= {arXiv preprint arXiv:1609.03234},
  year   = {2016}
}