基于后悔剪枝的不完全信息博弈中的降维与加速收敛
计算机科学与博弈论
2016-09-13 v1 人工智能
摘要
反事实后悔最小化(CFR)是求解零和不完全信息博弈最流行的迭代算法。后悔剪枝(RBP)是一种改进,它允许暂时剪枝表现不佳的动作,从而加速CFR。我们引入了Total RBP,这是一种新的RBP形式,它随着动作被剪枝而降低了CFR的空间需求。我们证明了在零和博弈中,它能渐近地剪枝任何不属于对某个 Nash 均衡的最佳响应的动作。这带来了可证明的更快收敛速度和更低的空间需求。实验表明,Total RBP 使空间减少了一个数量级,且减少因子随博弈规模的增大而增加。
引用
@article{arxiv.1609.03234,
title = {Reduced Space and Faster Convergence in Imperfect-Information Games via Regret-Based Pruning},
author = {Noam Brown and Tuomas Sandholm},
journal= {arXiv preprint arXiv:1609.03234},
year = {2016}
}