非参数上下文老虎机中最显著偏移的追踪
机器学习
2023-11-21 v2 机器学习
摘要
我们研究Lipschitz均值奖励函数可能随时间变化的非参数上下文老虎机。我们首先在此较少被理解的设定下,依据变化次数与总变差(二者均刻画上下文空间上分布的所有变化)建立极小极大动态后悔率,并指出最先进的方法在此设定下非最优。接着,我们致力于该设定的自适应问题,即在不知或的情况下达到极小极大率。至关重要的是,我们假定老虎机问题在给定上下文处局部观测时,不应受上下文空间其他部分奖励变化的影响。因此我们提出一种变化概念,称之为经历显著偏移,其更好地考量局部性,从而计数的变化远少于与。此外,类似于近期关于非平稳MAB的工作(Suk & Kpotufe, 2022),经历显著偏移仅计数均值奖励中最显著的变化,例如与观测上下文相关的严重最优臂变化。我们的主要结果是表明这一更具容忍度的变化概念事实上可被自适应达成。
引用
@article{arxiv.2307.05341,
title = {Tracking Most Significant Shifts in Nonparametric Contextual Bandits},
author = {Joe Suk and Samory Kpotufe},
journal= {arXiv preprint arXiv:2307.05341},
year = {2023}
}