中文

极大极小动作识别:一种用于博弈的 bandit 框架

统计理论 2016-02-16 v1 计算机科学与博弈论 机器学习 统计理论

摘要

我们研究了一个由蒙特卡洛树搜索激发的战略性 bandit 模型中的纯探索原始问题。它在于当玩家可以对顺序选择的动作对进行随机结果采样时,识别博弈中的最优动作。我们针对固定置信度设置提出了两种策略:基于上下置信界(lower- and upper-confidence bounds)的 Maximin-LUCB;以及通过依次消除次优动作来运作的 Maximin-Racing。我们讨论了两种方法的样本复杂度并实证比较了它们的性能。我们勾勒了下界分析,以及与最优算法可能的联系。

关键词

引用

@article{arxiv.1602.04676,
  title  = {Maximin Action Identification: A New Bandit Framework for Games},
  author = {Aurélien Garivier and Emilie Kaufmann and Wouter Koolen},
  journal= {arXiv preprint arXiv:1602.04676},
  year   = {2016}
}