单峰老虎机:遗憾下界与最优算法
机器学习
2014-05-21 v1 机器学习
摘要
我们考虑随机多臂老虎机问题,其中期望奖励是定义在偏序臂集上的单峰函数。这一重要问题类别最近在 (Cope 2009, Yu 2011) 中得到了研究。臂集要么是离散的(此时臂对应于有限图的顶点,其结构代表奖励的相似性),要么是连续的(此时臂属于一个有界区间)。对于离散单峰老虎机,我们推导了任何算法所能达到的遗憾的渐近下界,并提出了一种名为 OSUB 的算法,其遗憾与该下界相匹配。我们的算法最优地利用了问题的单峰结构,且令人惊讶的是,其渐近遗憾不依赖于臂的数量。我们还提供了 OSUB 在期望奖励随时间平滑演化的非平稳环境中的遗憾上界。数值实验支持了分析结果,表明 OSUB 的性能显著优于最先进算法。对于连续臂集,我们进行了简要讨论。我们表明,将适当的臂集离散化与 UCB 算法相结合,可产生阶最优的遗憾,并且在实践中优于近期提出的旨在利用单峰结构的算法。
引用
@article{arxiv.1405.5096,
title = {Unimodal Bandits: Regret Lower Bounds and Optimal Algorithms},
author = {Richard Combes and Alexandre Proutiere},
journal= {arXiv preprint arXiv:1405.5096},
year = {2014}
}
备注
ICML 2014 (technical report). arXiv admin note: text overlap with arXiv:1307.7309