中文

对抗多臂老虎机中对延迟与数据的自适应

机器学习 2020-10-14 v1 最优化与控制 机器学习

摘要

我们考虑延迟反馈下的对抗多臂老虎机问题。我们分析了 Exp3 算法的若干变体,这些变体仅使用决策时刻可用的(关于损失和延迟的)信息来调整步长,并获得了能自适应于观测到的(而非最坏情况的)延迟和/或损失序列的悔恨保证。首先,通过一种极为简单的证明技巧,我们表明在适当调参步长下,该算法在期望和高概率下均达到阶为 log(K)(TK+D)\sqrt{\log(K)(TK + D)} 的最优(至多对数因子)悔恨,其中 KK 为臂数,TT 为时间范围,DD 为累积延迟。该界的高概率版本是文献中首个高概率延迟自适应界,其关键依赖于在估计损失时使用隐式探索。随后,遵循 Zimmert 和 Seldin [2019],我们推广了这些结果,使算法能够“跳过”具有大延迟的轮次,从而得到阶为 TKlog(K)+R+DRˉlog(K)\sqrt{TK\log(K)} + |R| + \sqrt{D_{\bar{R}}\log(K)} 的悔恨界,其中 RR 为任意被跳过的轮次集合,DRˉD_{\bar{R}} 为其余轮次反馈的累积延迟。最后,我们给出算法的另一种数据自适应(AdaGrad 风格)版本,其悔恨自适应于观测到的(延迟)损失,而非仅自适应于累积延迟(该算法要求对最大延迟有先验上界,或在做出每个决策时预先知晓其延迟)。所得界在良性问题上可小数个数量级,并且可证明延迟仅通过最优臂的损失影响悔恨。

关键词

引用

@article{arxiv.2010.06022,
  title  = {Adapting to Delays and Data in Adversarial Multi-Armed Bandits},
  author = {András György and Pooria Joulani},
  journal= {arXiv preprint arXiv:2010.06022},
  year   = {2020}
}