Restless-UCB:一种高效低复杂度的在线 restless _bandit 算法
机器学习
2020-11-09 v2
摘要
我们研究在线 restless bandit 问题,其中每个臂的状态根据马尔可夫链演化,且拉动一个臂的奖励取决于被拉臂和相应马尔可夫链的当前状态。在本文中,我们提出 Restless-UCB,一种遵循先探索后提交框架的学习策略。在 Restless-UCB 中,我们提出了一种构造离线实例的新方法,其仅需 时间复杂度( 为臂的数量),比现有学习策略的复杂度指数级更优。我们还证明 Restless-UCB 达到了 的遗憾上界,其中 为马尔可夫链状态空间大小, 为时间范围。与现有算法相比,由于新颖地利用了一般 restless bandit 问题中转移的稀疏性,我们的结果消除了遗憾上界中的指数因子(关于 )。因此,我们的分析技术也可用于收紧现有算法的遗憾界。最后,我们基于真实世界数据集进行实验,将 Restless-UCB 策略与最先进的基准进行比较。我们的结果表明 Restless-UCB 在遗憾上优于现有算法,并显著减少了运行时间。
引用
@article{arxiv.2011.02664,
title = {Restless-UCB, an Efficient and Low-complexity Algorithm for Online Restless Bandits},
author = {Siwei Wang and Longbo Huang and John C. S. Lui},
journal= {arXiv preprint arXiv:2011.02664},
year = {2020}
}