中文

有限时域不安分多臂老虎机的渐近最优索引策略

最优化与控制 2017-07-04 v1

摘要

我们考虑具有有限时域且每周期多次抽取的不安分多臂老虎机(restless multi-armed bandit, RMAB)。利用拉格朗日松弛,我们用一组单臂问题来近似该问题。然后,我们提出一种基于索引的策略,该策略使用单臂问题的最优解来为各个臂分配索引,并证明当臂的数量趋于无穷时,该策略是渐近最优的。我们还通过仿真表明,在各种问题设置下,这种基于索引的策略优于最先进的启发式方法。

关键词

引用

@article{arxiv.1707.00205,
  title  = {An Asymptotically Optimal Index Policy for Finite-Horizon Restless Bandits},
  author = {Weici Hu and Peter Frazier},
  journal= {arXiv preprint arXiv:1707.00205},
  year   = {2017}
}