多臂无限时域 restless _bandit 的近最优性
机器学习
2022-03-31 v1 最优化与控制
摘要
Restless bandit是一类重要问题,在推荐系统、主动学习、收益管理等领域有应用。我们考虑具有多臂的无限时域折扣restless bandit,其中每期可拉动固定比例的臂,且各臂共享有限状态空间。尽管可通过随机动态规划计算平均情形最优策略,但所需计算量随臂数指数增长。因此,寻找可针对大高效计算且在此情形下近最优的可扩展策略十分重要,即意味着最优性间隙(即相对于最优策略的期望性能损失)每臂随大趋于零。然而,最流行的Whittle指数方法需要难以验证的可索引性条件才能良好定义,且需要另一难以验证的条件来保证的最优性间隙。我们提出一种解决这些困难的方法。通过将Whittle指数使用的全局拉格朗日乘子替换为截至有限截断点的每个时间周期各自的拉格朗日乘子序列,我们导出一类称为流体平衡策略的策略,其具有的最优性间隙。与Whittle指数不同,流体平衡策略无需可索引性即可良好定义,且其最优性间隙界普遍成立而无需充分条件。我们还通过实证表明,流体平衡策略在特定问题上提供了最先进(SOTA)的性能。
引用
@article{arxiv.2203.15853,
title = {Near-optimality for infinite-horizon restless bandits with many arms},
author = {Xiangyu Zhang and Peter I. Frazier},
journal= {arXiv preprint arXiv:2203.15853},
year = {2022}
}