中文

倍增技巧对多臂老虎机的作用与局限

机器学习 2018-03-20 v1 机器学习 统计理论 统计理论

摘要

如果一个在线强化学习算法不需要预先知道实验的时间跨度 T,则它是 anytime 的。从任意非 anytime 算法获得 anytime 算法的一种著名技巧是“倍增技巧”。在对抗或随机多臂老虎机的背景下,算法的性能由其遗憾衡量,我们研究了递增时间跨度的两类序列族(几何和指数),以推广先前已知的结果,即某些倍增技巧可用于保持某些遗憾界。在广泛的设定下,我们证明了几何倍增技巧可用于保持 RT=O(T)R_T = O(\sqrt{T}) 的(极小化极大)界,但不能保持 RT=O(logT)R_T = O(\log T) 的(分布依赖)界。我们解释了为什么指数倍增技巧可能更好,因为它们能保持 RT=O(logT)R_T = O(\log T) 的界,并且接近于保持 RT=O(T)R_T = O(\sqrt{T}) 的界。

关键词

引用

@article{arxiv.1803.06971,
  title  = {What Doubling Tricks Can and Can't Do for Multi-Armed Bandits},
  author = {Lilian Besson and Emilie Kaufmann},
  journal= {arXiv preprint arXiv:1803.06971},
  year   = {2018}
}