中文

多臂 restless _bandit 问题:击败中心极限定理

最优化与控制 2021-07-27 v1 机器学习 概率论

摘要

我们考虑有限时域 restless bandit 问题,每期多次拉动,其在推荐系统、主动学习、收益管理以及许多其他领域发挥重要作用。虽然原则上可以使用动态规划计算最优策略,但所需计算随臂数 NN 指数增长。因此,理解索引策略及其他可针对大 NN 高效计算的策略的性能具有重要价值。我们研究此类策略在最优性间隙(即相比最优策略的期望性能损失)上的增长,在 Whittle 提出的经典渐近机制中,NN 增长而每期可拉动臂的比例保持恒定。来自中心极限定理的直觉与最紧的先前理论界表明该最优性间隙应像 O(N)O(\sqrt{N}) 增长。令人惊讶的是,我们展示有可能超越此界。我们刻画了一个非退化条件以及一类广泛的新型可实际计算的策略,称为流体优先级(fluid-priority)策略,其最优性间隙为 O(1)O(1)。这些包括最广泛使用的索引策略。当该非退化条件不成立时,我们展示流体优先级策略仍有 O(N)O(\sqrt{N}) 的最优性间隙,显著推广了已知收敛速率的策略类。我们通过在数值实验中对一组 restless bandit 问题证明流体优先级策略提供最先进的性能。

关键词

引用

@article{arxiv.2107.11911,
  title  = {Restless Bandits with Many Arms: Beating the Central Limit Theorem},
  author = {Xiangyu Zhang and Peter I. Frazier},
  journal= {arXiv preprint arXiv:2107.11911},
  year   = {2021}
}