MAB 中的延迟作为回报
机器学习
2024-10-16 v2
摘要
本文我们研究了经典随机多臂老虎机(MAB)问题的一种变体,在该变体中,代理人收到的回报(无论是成本还是奖励)既是延迟的,同时也直接对应于延迟的大小。这一设置忠实地建模了许多真实场景,例如数据包在给定路由选择下穿越网络所需的时间(其中延迟充当代理人的成本);或用户对给定内容花费的时间(其中延迟充当代理人的奖励)。我们的主要贡献包括对成本和奖励两种情形下的紧密上界和下界。在延迟充当成本的情形下,我们是首次进行讨论,证明了最优 regret为,其中T为最大步数,为次优间隙,为各臂的最小预期延迟。在延迟充当奖励的情形下,我们证明了最优 regret为,其中为次大预期延迟。这些结果优于一般延迟相关回报情形下的regret,后者的regret为,其中D为最大可能延迟。我们的regret上界突显了成本和奖励情形之间的差异,显示出在成本情形下的改进在奖励情形下要更为显著。最后,我们在理论结果之外进行了经验评估。
引用
@article{arxiv.2408.15158,
title = {Delay as Payoff in MAB},
author = {Ofir Schlisselberg and Ido Cohen and Tal Lancewicki and Yishay Mansour},
journal= {arXiv preprint arXiv:2408.15158},
year = {2024}
}