一种兼具最优与最差世界特性的延迟反馈赌博机算法及其对过度延迟的鲁棒性
机器学习
2024-05-29 v2 机器学习
摘要
我们提出了一种用于可变延迟反馈赌博机(bandits)的新best-of-both-worlds算法。与已有工作需预先知道最大延迟且遗憾(regret)对其呈线性依赖不同,我们的算法可容忍任意高达阶(其中为时间范围)的过度延迟。该算法基于三项可能具有独立意义的技术创新:(1)我们引入了首个在best-of-both-worlds设定下有效的隐式探索方案。(2)我们引入了首个不依赖于延迟有界性的分布漂移控制。该控制基于隐式探索方案与对过度延迟观测的自适应跳过。(3)我们引入了将标准遗憾与漂移遗憾相关联且不需依赖延迟有界性的过程。在概念层面,我们论证了带延迟反馈的best-of-both-worlds赌博机的复杂度由决策时缺失信息的数量(以未决观测数衡量)而非信息缺失的时间(以延迟衡量)所刻画。
引用
@article{arxiv.2308.10675,
title = {A Best-of-both-worlds Algorithm for Bandits with Delayed Feedback with Robustness to Excessive Delays},
author = {Saeed Masoudian and Julian Zimmert and Yevgeny Seldin},
journal= {arXiv preprint arXiv:2308.10675},
year = {2024}
}