基于基线的广泛形式博弈蒙特卡洛反事实遗憾最小化方差缩减方法(VR-MCCFR)
计算机科学与博弈论
2018-09-11 v1 人工智能
摘要
从不完美信息博弈的交互样本中学习策略是一个具有挑战性的问题。该设定下的一种常用方法——蒙特卡洛反事实遗憾最小化(MCCFR)——由于高方差可能导致长期收敛速度缓慢。在本文中,我们引入了一种适用于 MCCFR 任意采样变体的方差缩减技术(VR-MCCFR)。使用该技术,每次迭代的估计值与更新被重构为采样值与状态-动作基线的函数,类似于其在策略梯度强化学习中的使用。新公式允许估计值从同一回合内的其他估计值进行引导,使基线的益处沿采样轨迹传播;即使从其他估计值引导,估计值仍保持无偏。最后,我们表明在给定完美基线的情况下,价值估计的方差可降至零。实验评估显示 VR-MCCFR 带来了数量级的加速,同时经验方差降低了三个数量级。方差的降低使得 CFR+ 首次能够与采样结合使用,将加速提升至两个数量级。
引用
@article{arxiv.1809.03057,
title = {Variance Reduction in Monte Carlo Counterfactual Regret Minimization (VR-MCCFR) for Extensive Form Games using Baselines},
author = {Martin Schmid and Neil Burch and Marc Lanctot and Matej Moravcik and Rudolf Kadlec and Michael Bowling},
journal= {arXiv preprint arXiv:1809.03057},
year = {2018}
}