中文

Restless-UCB:一种高效低复杂度的在线 restless _bandit 算法

机器学习 2020-11-09 v2

摘要

我们研究在线 restless bandit 问题,其中每个臂的状态根据马尔可夫链演化,且拉动一个臂的奖励取决于被拉臂和相应马尔可夫链的当前状态。在本文中,我们提出 Restless-UCB,一种遵循先探索后提交框架的学习策略。在 Restless-UCB 中,我们提出了一种构造离线实例的新方法,其仅需 O(N)O(N) 时间复杂度(NN 为臂的数量),比现有学习策略的复杂度指数级更优。我们还证明 Restless-UCB 达到了 O~((N+M3)T23)\tilde{O}((N+M^3)T^{2\over 3}) 的遗憾上界,其中 MM 为马尔可夫链状态空间大小,TT 为时间范围。与现有算法相比,由于新颖地利用了一般 restless bandit 问题中转移的稀疏性,我们的结果消除了遗憾上界中的指数因子(关于 M,NM,N)。因此,我们的分析技术也可用于收紧现有算法的遗憾界。最后,我们基于真实世界数据集进行实验,将 Restless-UCB 策略与最先进的基准进行比较。我们的结果表明 Restless-UCB 在遗憾上优于现有算法,并显著减少了运行时间。

关键词

引用

@article{arxiv.2011.02664,
  title  = {Restless-UCB, an Efficient and Low-complexity Algorithm for Online Restless Bandits},
  author = {Siwei Wang and Longbo Huang and John C. S. Lui},
  journal= {arXiv preprint arXiv:2011.02664},
  year   = {2020}
}