平均奖赏下的 restless _bandit:打破一致全局吸引子假设
机器学习
2024-01-17 v3 最优化与控制
概率论
机器学习
摘要
我们研究无限时域 restless bandit 问题在离散时间和连续时间设定下的平均奖赏准则。一个基本目标是高效计算策略,使得当臂数 增大时最优性差距逐渐消失。现有的渐近最优性结果都依赖于一致全局吸引子性质(UGAP),这是一个复杂且难以验证的假设。在本文中,我们提出一个通用的、基于仿真的框架 Follow-the-Virtual-Advice,将任意单臂策略转化为原始 臂问题的策略。这是通过在每个臂上仿真单臂策略并小心地将真实状态引导向仿真状态来实现的。我们的框架可被实例化以产生具有 最优性差距的策略。在离散时间设定下,我们的结果在一个更简单的同步假设下成立,该假设覆盖了一些违背 UGAP 的问题实例。更值得注意的是,在连续时间设定下,除标准的单链条件外我们不需要\emph{任何}额外假设。在这两种设定下,我们的工作都是首个不要求 UGAP 的渐近最优性结果。
引用
@article{arxiv.2306.00196,
title = {Restless Bandits with Average Reward: Breaking the Uniform Global Attractor Assumption},
author = {Yige Hong and Qiaomin Xie and Yudong Chen and Weina Wang},
journal= {arXiv preprint arXiv:2306.00196},
year = {2024}
}
备注
NeurIPS 2023. 35 pages, 8 figures