基于末次切换的依赖型饱和与季节性_bandit分析
机器学习
2022-03-08 v5
摘要
受人类喜好某种程度上的不可预测性或新奇感、并可能因此在与平稳策略交互时迅速厌倦这一事实的启发,我们引入了一种新颖的非平稳bandit问题,其中臂的期望奖励完全由该臂上次参与动作切换以来所经过的时间决定。我们的模型推广了先前依赖于延迟的奖励概念,并放宽了关于奖励函数的大部分假设。这使得对渐进性饱和与周期性行为等现象的建模成为可能。基于组合半bandit(CSB)框架,我们设计了一种算法,并证明了其相对于最优非平稳策略(计算为NP难)的遗憾界。与先前工作类似,我们的遗憾分析基于定义并求解近似与估计之间的适当权衡。初步实验证实了我们的算法优于预言贪婪方法和朴素CSB求解器。
引用
@article{arxiv.2110.11819,
title = {A Last Switch Dependent Analysis of Satiation and Seasonality in Bandits},
author = {Pierre Laforgue and Giulia Clerici and Nicolò Cesa-Bianchi and Ran Gilad-Bachrach},
journal= {arXiv preprint arXiv:2110.11819},
year = {2022}
}