有限时域不安分多臂老虎机的渐近最优索引策略
最优化与控制
2017-07-04 v1
摘要
我们考虑具有有限时域且每周期多次抽取的不安分多臂老虎机(restless multi-armed bandit, RMAB)。利用拉格朗日松弛,我们用一组单臂问题来近似该问题。然后,我们提出一种基于索引的策略,该策略使用单臂问题的最优解来为各个臂分配索引,并证明当臂的数量趋于无穷时,该策略是渐近最优的。我们还通过仿真表明,在各种问题设置下,这种基于索引的策略优于最先进的启发式方法。
引用
@article{arxiv.1707.00205,
title = {An Asymptotically Optimal Index Policy for Finite-Horizon Restless Bandits},
author = {Weici Hu and Peter Frazier},
journal= {arXiv preprint arXiv:1707.00205},
year = {2017}
}