中文

扩展式博弈中的低方差与零方差基线

计算机科学与博弈论 2019-07-24 v1 人工智能

摘要

扩展式博弈(EFGs)是不完美信息下多智能体交互的常用模型。求解这些博弈的最先进算法通常执行博弈树的完整遍历,在大型博弈中可能会极其缓慢。作为替代,基于采样的方法(如蒙特卡洛反事实遗憾最小化)在树中行走一条或多条轨迹,每次迭代仅触及部分节点,代价是由于采样值的方差而需要更多迭代才能收敛。在本文中,我们扩展了近期利用基线估计来降低该方差的工作。我们引入了扩展式博弈中基线校正值的框架,该框架推广了先前的工作。在我们的框架内,我们提出了新的基线函数,与现有技术相比显著降低了方差。我们证明,在特定采样方案下,此类函数的某一特定选择——预测基线——可被证明是最优的。这允许即使在采样轨迹上也能高效计算零方差值估计。

关键词

引用

@article{arxiv.1907.09633,
  title  = {Low-Variance and Zero-Variance Baselines for Extensive-Form Games},
  author = {Trevor Davis and Martin Schmid and Michael Bowling},
  journal= {arXiv preprint arXiv:1907.09633},
  year   = {2019}
}

备注

Under review for NeurIPS 2019