中文

MAB 中的延迟作为回报

机器学习 2024-10-16 v2

摘要

本文我们研究了经典随机多臂老虎机(MAB)问题的一种变体,在该变体中,代理人收到的回报(无论是成本还是奖励)既是延迟的,同时也直接对应于延迟的大小。这一设置忠实地建模了许多真实场景,例如数据包在给定路由选择下穿越网络所需的时间(其中延迟充当代理人的成本);或用户对给定内容花费的时间(其中延迟充当代理人的奖励)。我们的主要贡献包括对成本和奖励两种情形下的紧密上界和下界。在延迟充当成本的情形下,我们是首次进行讨论,证明了最优 regret为i:Δi>0logTΔi+d\sum_{i:\Delta_i > 0}\frac{\log T}{\Delta_i} + d^*,其中T为最大步数,Δi\Delta_i为次优间隙,dd^*为各臂的最小预期延迟。在延迟充当奖励的情形下,我们证明了最优 regret为i:Δi>0logTΔi+dˉ\sum_{i:\Delta_i > 0}\frac{\log T}{\Delta_i} + \bar{d},其中dˉ\bar{d}为次大预期延迟。这些结果优于一般延迟相关回报情形下的regret,后者的regret为i:Δi>0logTΔi+D\sum_{i:\Delta_i > 0}\frac{\log T}{\Delta_i} + D,其中D为最大可能延迟。我们的regret上界突显了成本和奖励情形之间的差异,显示出在成本情形下的改进在奖励情形下要更为显著。最后,我们在理论结果之外进行了经验评估。

关键词

引用

@article{arxiv.2408.15158,
  title  = {Delay as Payoff in MAB},
  author = {Ofir Schlisselberg and Ido Cohen and Tal Lancewicki and Yishay Mansour},
  journal= {arXiv preprint arXiv:2408.15158},
  year   = {2024}
}