中文

基于线性规划的 restless bandit 策略:渐近最优性(指数快速)的充要条件

最优化与控制 2023-12-25 v3 概率论

摘要

我们提供了一个框架来分析 restless Markovian bandit 模型在有限与无限时间 horizon 下的控制策略。我们证明了当臂的数量趋于无穷时,最优控制策略的值收敛于一个线性规划(LP)的解。我们给出了一个通用控制策略满足以下条件的充要条件:i)渐近最优;ii)具有平方根收敛速率的渐近最优;iii)具有指数速率的渐近最优。随后我们构造了 LP-index 策略,该策略在所有模型上具有平方根收敛速率的渐近最优性,并且在有限 horizon 下非退化、在无限 horizon 下满足一致全局吸引子性质时具有指数速率。接下来我们定义 LP-update 策略,其本质上是一种重复的 LP-index 策略,在每一个决策时刻求解一个新的线性规划。我们提供了数值实验来比较基于 LP 的策略的效率。我们将 LP-index 策略与 LP-update 策略同其他启发式方法进行比较。我们的结果表明,LP-update 策略总体上优于 LP-index 策略,并且当转移矩阵被错误估计时可能具有显著优势。

关键词

引用

@article{arxiv.2106.10067,
  title  = {LP-based policies for restless bandits: necessary and sufficient conditions for (exponentially fast) asymptotic optimality},
  author = {Nicolas Gast and Bruno Gaujal and Chen Yan},
  journal= {arXiv preprint arXiv:2106.10067},
  year   = {2023}
}

备注

Mathematics of Operations Research, 2023