Copeland对决赌博机问题:后悔下界、最优算法与计算高效算法
机器学习
2016-05-25 v2 机器学习
摘要
我们研究K-臂对决赌博机问题,这是标准随机赌博机问题的一个变体,其中反馈仅限于一对臂的相对比较。通过推导渐近后悔界,刻画了推荐Copeland赢家(即击败最多其他臂的臂)的难度。我们提出Copeland Winners Relative Minimum Empirical Divergence (CW-RMED) 并推导其渐近最优后悔界。然而,尚不清楚该算法能否高效计算。为解决此问题,我们设计了一个高效版本(ECW-RMED)并推导其渐近后悔界。对决赌博机算法的实验比较表明ECW-RMED显著优于现有算法。
引用
@article{arxiv.1605.01677,
title = {Copeland Dueling Bandit Problem: Regret Lower Bound, Optimal Algorithm, and Computationally Efficient Algorithm},
author = {Junpei Komiyama and Junya Honda and Hiroshi Nakagawa},
journal= {arXiv preprint arXiv:1605.01677},
year = {2016}
}
备注
To appear in ICML2016