极大极小动作识别:一种用于博弈的 bandit 框架
统计理论
2016-02-16 v1 计算机科学与博弈论
机器学习
统计理论
摘要
我们研究了一个由蒙特卡洛树搜索激发的战略性 bandit 模型中的纯探索原始问题。它在于当玩家可以对顺序选择的动作对进行随机结果采样时,识别博弈中的最优动作。我们针对固定置信度设置提出了两种策略:基于上下置信界(lower- and upper-confidence bounds)的 Maximin-LUCB;以及通过依次消除次优动作来运作的 Maximin-Racing。我们讨论了两种方法的样本复杂度并实证比较了它们的性能。我们勾勒了下界分析,以及与最优算法可能的联系。
引用
@article{arxiv.1602.04676,
title = {Maximin Action Identification: A New Bandit Framework for Games},
author = {Aurélien Garivier and Emilie Kaufmann and Wouter Koolen},
journal= {arXiv preprint arXiv:1602.04676},
year = {2016}
}