中文

改进延迟反馈多臂老虎机的 Best-of-Both-Worlds 遗憾界

机器学习 2025-10-21 v2

摘要

我们在 Best-of-Both-Worlds (BoBW) 框架下研究具有对抗性选择延迟的多臂老虎机问题,该框架旨在在随机和对抗性环境中均实现接近最优的性能。尽管先前的工作在这一目标上取得了进展,但现有算法与已知下界之间仍存在显著差距,尤其是在随机设置中。我们的主要贡献是一种新算法,在对数因子范围内,它在每种设置下均分别匹配了已知下界。在对抗性情况下,我们的算法实现了 O~(KT+D)\widetilde{O}(\sqrt{KT} + \sqrt{D}) 的遗憾界,在对数项范围内是最优的,其中 TT 是轮数,KK 是臂数,DD 是累积延迟。在随机情况下,我们提供了一个遗憾界,其标度为 i:Δi>0(logT/Δi)+1KΔiσmax\sum_{i:\Delta_i>0}\left(\log T/\Delta_i\right) + \frac{1}{K}\sum \Delta_i \sigma_{max},其中 Δi\Delta_i 是臂 ii 的次优性差距,σmax\sigma_{\max} 是缺失观测的最大数量。据我们所知,这是在延迟环境下首个同时在随机和对抗性机制中匹配下界的 BoBW 算法。此外,甚至超越 BoBW 设置,我们的随机遗憾界是首个在对抗性延迟下匹配已知下界的算法,将第二项相较于已知最佳结果改进了 KK 倍。

关键词

引用

@article{arxiv.2505.24193,
  title  = {Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback},
  author = {Ofir Schlisselberg and Tal Lancewicki and Peter Auer and Yishay Mansour},
  journal= {arXiv preprint arXiv:2505.24193},
  year   = {2025}
}