中文

延迟_bandit:中间观测何时有所帮助?

机器学习 2023-05-31 v1

摘要

我们研究具有延迟反馈与中间观测的 KK 臂_bandit问题。我们考虑一种模型,其中中间观测表现为有限状态的形式,在采取动作后立即被观测到,而损失在对抗性选择的延迟之后才被观测到。我们表明,状态到损失的映射机制决定了问题的复杂度,而与动作到状态的映射是随机的还是对抗性的无关。如果状态到损失的映射是对抗性的,则遗憾率(在对数因子内)为 (K+d)T\sqrt{(K+d)T} 阶,其中 TT 为时间范围,dd 为固定延迟。这与具有延迟反馈但无中间观测的 KK 臂_bandit的遗憾率相匹配,意味着中间观测并无帮助。然而,如果状态到损失的映射是随机的,我们表明遗憾以 (K+min{S,d})T\sqrt{\big(K+\min\{|\mathcal{S}|,d\}\big)T} 的速率增长(在对数因子内),这意味着若状态数 S|\mathcal{S}| 小于延迟,则中间观测有所帮助。我们还针对非均匀延迟提供了精炼的高概率遗憾上界,并对我们的算法进行了实验验证。

关键词

引用

@article{arxiv.2305.19036,
  title  = {Delayed Bandits: When Do Intermediate Observations Help?},
  author = {Emmanuel Esposito and Saeed Masoudian and Hao Qiu and Dirk van der Hoeven and Nicolò Cesa-Bianchi and Yevgeny Seldin},
  journal= {arXiv preprint arXiv:2305.19036},
  year   = {2023}
}