一种适用于延迟反馈老虎机的兼得两者优势算法
机器学习
2022-07-01 v1 机器学习
摘要
我们针对 Zimmert 和 Seldin [2020] 的对抗式多臂老虎机延迟反馈算法提出了一种改进调参方法,该方法在 Zimmert 和 Seldin 所证明的极小极大最优对抗后悔界之外,同时在具有固定延迟的随机设定下实现了近最优的后悔保证。具体而言,对抗后悔保证为 ,其中 为时间范围, 为臂的数量, 为固定延迟;而随机后悔保证为 ,其中 为次优间隙。我们还将该算法推广到任意延迟的情形,其基于最大延迟 的预言机知识,并在对抗情形下取得 的后悔界(其中 为总延迟),在随机情形下取得 的后悔界(其中 为未决观测的最大数量)。最后,我们给出了一个下界,该下界与 Zimmert 和 Seldin [2020] 的跳过技术在对抗设定下所取得的后悔上界相匹配。
引用
@article{arxiv.2206.14906,
title = {A Best-of-Both-Worlds Algorithm for Bandits with Delayed Feedback},
author = {Saeed Masoudian and Julian Zimmert and Yevgeny Seldin},
journal= {arXiv preprint arXiv:2206.14906},
year = {2022}
}