对抗多臂老虎机中对延迟与数据的自适应
机器学习
2020-10-14 v1 最优化与控制
机器学习
摘要
我们考虑延迟反馈下的对抗多臂老虎机问题。我们分析了 Exp3 算法的若干变体,这些变体仅使用决策时刻可用的(关于损失和延迟的)信息来调整步长,并获得了能自适应于观测到的(而非最坏情况的)延迟和/或损失序列的悔恨保证。首先,通过一种极为简单的证明技巧,我们表明在适当调参步长下,该算法在期望和高概率下均达到阶为 的最优(至多对数因子)悔恨,其中 为臂数, 为时间范围, 为累积延迟。该界的高概率版本是文献中首个高概率延迟自适应界,其关键依赖于在估计损失时使用隐式探索。随后,遵循 Zimmert 和 Seldin [2019],我们推广了这些结果,使算法能够“跳过”具有大延迟的轮次,从而得到阶为 的悔恨界,其中 为任意被跳过的轮次集合, 为其余轮次反馈的累积延迟。最后,我们给出算法的另一种数据自适应(AdaGrad 风格)版本,其悔恨自适应于观测到的(延迟)损失,而非仅自适应于累积延迟(该算法要求对最大延迟有先验上界,或在做出每个决策时预先知晓其延迟)。所得界在良性问题上可小数个数量级,并且可证明延迟仅通过最优臂的损失影响悔恨。
引用
@article{arxiv.2010.06022,
title = {Adapting to Delays and Data in Adversarial Multi-Armed Bandits},
author = {András György and Pooria Joulani},
journal= {arXiv preprint arXiv:2010.06022},
year = {2020}
}