改进延迟反馈多臂老虎机的 Best-of-Both-Worlds 遗憾界
机器学习
2025-10-21 v2
摘要
我们在 Best-of-Both-Worlds (BoBW) 框架下研究具有对抗性选择延迟的多臂老虎机问题,该框架旨在在随机和对抗性环境中均实现接近最优的性能。尽管先前的工作在这一目标上取得了进展,但现有算法与已知下界之间仍存在显著差距,尤其是在随机设置中。我们的主要贡献是一种新算法,在对数因子范围内,它在每种设置下均分别匹配了已知下界。在对抗性情况下,我们的算法实现了 的遗憾界,在对数项范围内是最优的,其中 是轮数, 是臂数, 是累积延迟。在随机情况下,我们提供了一个遗憾界,其标度为 ,其中 是臂 的次优性差距, 是缺失观测的最大数量。据我们所知,这是在延迟环境下首个同时在随机和对抗性机制中匹配下界的 BoBW 算法。此外,甚至超越 BoBW 设置,我们的随机遗憾界是首个在对抗性延迟下匹配已知下界的算法,将第二项相较于已知最佳结果改进了 倍。
引用
@article{arxiv.2505.24193,
title = {Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback},
author = {Ofir Schlisselberg and Tal Lancewicki and Peter Auer and Yishay Mansour},
journal= {arXiv preprint arXiv:2505.24193},
year = {2025}
}