中文

在无全局吸引子假设下实现平均奖励无限期休闲多臂老虎机问题的指数渐近最优性

机器学习 2024-10-18 v2 最优化与控制 概率论

摘要

我们考虑无限期平均奖励无限期休闲多臂老虎机问题。我们提出了一种新的两子集策略,该策略维护两个动态子集:一个子集的臂拥有接近最优的状态分布并根据最优局部控制例程采取行动;另一个子集的臂被驱动 towards 最优状态分布并逐渐并入第一个子集。我们证明,在满足周期性无唯一性、非退化和局部稳定性等温和假设下,我们的两子集策略在N臂问题中具有指数渐近最优性, optimality gap 为 O(exp(CN))O(\exp(-C N))。我们的策略是首个在上述易于验证的假设下实现指数渐近最优性的策略,而前期工作要么需要强大的全局吸引子假设,要么仅实现 O(1/N)O(1/\sqrt{N}) 的 optimality gap。我们进一步通过展示在任何三个假设被破坏时指数渐近最优性不可实现的示例,讨论了弱化假设的障碍。值得注意的是,我们证明了一个较大类局部不稳定无限期休闲多臂老虎机的下界,表明局部稳定性对于指数渐近最优性尤其关键。最后,我们使用仿真结果表明,两子集策略在特定无限期休闲多臂老虎机问题中优于先前策略,总体上表现出竞争力。

关键词

引用

@article{arxiv.2405.17882,
  title  = {Achieving Exponential Asymptotic Optimality in Average-Reward Restless Bandits without Global Attractor Assumption},
  author = {Yige Hong and Qiaomin Xie and Yudong Chen and Weina Wang},
  journal= {arXiv preprint arXiv:2405.17882},
  year   = {2024}
}

备注

55 pages, 4 figures. In this version we included simulations