倍增技巧对多臂老虎机的作用与局限
机器学习
2018-03-20 v1 机器学习
统计理论
统计理论
摘要
如果一个在线强化学习算法不需要预先知道实验的时间跨度 T,则它是 anytime 的。从任意非 anytime 算法获得 anytime 算法的一种著名技巧是“倍增技巧”。在对抗或随机多臂老虎机的背景下,算法的性能由其遗憾衡量,我们研究了递增时间跨度的两类序列族(几何和指数),以推广先前已知的结果,即某些倍增技巧可用于保持某些遗憾界。在广泛的设定下,我们证明了几何倍增技巧可用于保持 的(极小化极大)界,但不能保持 的(分布依赖)界。我们解释了为什么指数倍增技巧可能更好,因为它们能保持 的界,并且接近于保持 的界。
关键词
引用
@article{arxiv.1803.06971,
title = {What Doubling Tricks Can and Can't Do for Multi-Armed Bandits},
author = {Lilian Besson and Emilie Kaufmann},
journal= {arXiv preprint arXiv:1803.06971},
year = {2018}
}