重充能收益下的非平稳多臂赌博机:具有次线性悔值的改进规划
机器学习
2022-10-13 v2 数据结构与算法
摘要
随机多臂赌博机设定近来在非平稳情形下得到研究,其中每个动作的均值收益是自其上一次被选择以来所经过轮数的非递减函数。该模型刻画了用户自然的行为特征,这些特征关键性地决定了推荐平台、广告投放系统等的表现。即便假设已知均值收益函数,在上述模型中计算最优规划也是 NP 难的,而现有最优结果是在每轮至多选择一个臂的情形下的 -近似算法。我们首先关注均值收益函数已知的设定。在此设定下,我们通过对随机化 LP 舍入与时间相关(交错)调度方法的新颖结合,开发出一种多项式时间的 -近似算法(渐近且在期望意义下),显著改进了规划问题的最佳已知保证。此外,相较于先前工作,我们的算法在每轮可选择多于一个臂的情形下也取得了改进的保证。转向赌博机设定,当均值收益函数初始未知时,我们展示了如何将我们的算法转化为具有次线性悔值的赌博机算法。
引用
@article{arxiv.2205.14790,
title = {Non-Stationary Bandits under Recharging Payoffs: Improved Planning with Sublinear Regret},
author = {Orestis Papadigenopoulos and Constantine Caramanis and Sanjay Shakkottai},
journal= {arXiv preprint arXiv:2205.14790},
year = {2022}
}
备注
Accepted for publication to NeurIPS 2022