中文

一种适用于延迟反馈老虎机的兼得两者优势算法

机器学习 2022-07-01 v1 机器学习

摘要

我们针对 Zimmert 和 Seldin [2020] 的对抗式多臂老虎机延迟反馈算法提出了一种改进调参方法,该方法在 Zimmert 和 Seldin 所证明的极小极大最优对抗后悔界之外,同时在具有固定延迟的随机设定下实现了近最优的后悔保证。具体而言,对抗后悔保证为 O(TK+dTlogK)\mathcal{O}(\sqrt{TK} + \sqrt{dT\log K}),其中 TT 为时间范围,KK 为臂的数量,dd 为固定延迟;而随机后悔保证为 O(ii(1Δilog(T)+dΔilogK)+dK1/3logK)\mathcal{O}\left(\sum_{i \neq i^*}(\frac{1}{\Delta_i} \log(T) + \frac{d}{\Delta_{i}\log K}) + d K^{1/3}\log K\right),其中 Δi\Delta_i 为次优间隙。我们还将该算法推广到任意延迟的情形,其基于最大延迟 dmaxd_{max} 的预言机知识,并在对抗情形下取得 O(TK+DlogK+dmaxK1/3logK)\mathcal{O}(\sqrt{TK} + \sqrt{D\log K} + d_{max}K^{1/3} \log K) 的后悔界(其中 DD 为总延迟),在随机情形下取得 O(ii(1Δilog(T)+σmaxΔilogK)+dmaxK1/3logK)\mathcal{O}\left(\sum_{i \neq i^*}(\frac{1}{\Delta_i} \log(T) + \frac{\sigma_{max}}{\Delta_{i}\log K}) + d_{max}K^{1/3}\log K\right) 的后悔界(其中 σmax\sigma_{max} 为未决观测的最大数量)。最后,我们给出了一个下界,该下界与 Zimmert 和 Seldin [2020] 的跳过技术在对抗设定下所取得的后悔上界相匹配。

关键词

引用

@article{arxiv.2206.14906,
  title  = {A Best-of-Both-Worlds Algorithm for Bandits with Delayed Feedback},
  author = {Saeed Masoudian and Julian Zimmert and Yevgeny Seldin},
  journal= {arXiv preprint arXiv:2206.14906},
  year   = {2022}
}