中文

无平滑性假设的单峰多臂老虎机问题

机器学习 2015-03-09 v2

摘要

我们研究具有连续臂集且期望奖励为臂的连续单峰函数的随机多臂老虎机问题。关于期望奖励函数的平滑性和结构,未作任何额外假设。针对此类问题,我们提出了随机五等分(Stochastic Pentachotomy, SP)算法,并推导了其遗憾(regret)和优化误差的有限时间上界。特别地,我们证明对于任意在最大值点 xx^\star 附近表现为 μ(x)=μ(x)Cxxξ\mu(x)=\mu(x^\star)-C|x-x^\star|^\xi(其中 ξ,C>0\xi, C>0)的期望奖励函数 μ\mu,SP 算法是阶最优的。即当时问视界 TT 趋于无穷大时,其遗憾和优化误差分别按 O(Tlog(T))O(\sqrt{T\log(T)})O(log(T)/T)O(\sqrt{\log(T)/T}) 缩放。这些缩放比例的实现无需知晓 ξ\xiCC。我们的算法基于渐近最优的序贯统计检验,用于逐步修剪以高概率包含最优臂的区间。据我们所知,SP 算法是首个针对非平滑期望奖励函数以及平滑性未知的平滑函数,在忽略对数因子的情况下,实现遗憾和优化误差分别按 O(T)O(\sqrt{T})O(1/T)O(1/\sqrt{T}) 缩放的序贯臂选择规则。

关键词

引用

@article{arxiv.1406.7447,
  title  = {Unimodal Bandits without Smoothness},
  author = {Richard Combes and Alexandre Proutiere},
  journal= {arXiv preprint arXiv:1406.7447},
  year   = {2015}
}

备注

25 pages