扩展式博弈中的低方差与零方差基线
计算机科学与博弈论
2019-07-24 v1 人工智能
摘要
扩展式博弈(EFGs)是不完美信息下多智能体交互的常用模型。求解这些博弈的最先进算法通常执行博弈树的完整遍历,在大型博弈中可能会极其缓慢。作为替代,基于采样的方法(如蒙特卡洛反事实遗憾最小化)在树中行走一条或多条轨迹,每次迭代仅触及部分节点,代价是由于采样值的方差而需要更多迭代才能收敛。在本文中,我们扩展了近期利用基线估计来降低该方差的工作。我们引入了扩展式博弈中基线校正值的框架,该框架推广了先前的工作。在我们的框架内,我们提出了新的基线函数,与现有技术相比显著降低了方差。我们证明,在特定采样方案下,此类函数的某一特定选择——预测基线——可被证明是最优的。这允许即使在采样轨迹上也能高效计算零方差值估计。
引用
@article{arxiv.1907.09633,
title = {Low-Variance and Zero-Variance Baselines for Extensive-Form Games},
author = {Trevor Davis and Martin Schmid and Michael Bowling},
journal= {arXiv preprint arXiv:1907.09633},
year = {2019}
}
备注
Under review for NeurIPS 2019