方差如何塑造情境型多臂老虎机的后悔值?
机器学习
2024-11-28 v2 机器学习
摘要
我们考虑可实现的情境型多臂老虎机(contextual bandits),使用一般函数逼近,研究小奖励方差如何导致优于最小混沌后悔值界限。与混沌界限不同,我们表明,贪欲维数——一种函数类的复杂度度量——在方差相关的界限中发挥关键作用。我们考虑两种类型的对手:(1)弱对手:对手在观察学习者的动作之前设置奖励方差。在这种设置下,我们证明当时,奖励为是不可避免的,其中是动作的数量,是总轮数,是轮的总方差。对于的情形,我们推导出在方差在每个轮次开始时披露的特殊情况下, nearly matching 上界。(2)强对手:对手在观察学习者的动作后设置奖励方差。在这种设置下,我们证明当时,奖励为是不可避免的。在这种设置下,我们提供了阶的上界。此外,我们检查了函数类额外提供奖励分布信息的设置,正如Wang等人(2024)所研究的那样。我们证明其工作中建立的后悔值界限在时是不可改进的。然而,采用略微不同的总方差定义,并假设奖励服从正态分布后,可实现后悔值。
引用
@article{arxiv.2410.12713,
title = {How Does Variance Shape the Regret in Contextual Bandits?},
author = {Zeyu Jia and Jian Qian and Alexander Rakhlin and Chen-Yu Wei},
journal= {arXiv preprint arXiv:2410.12713},
year = {2024}
}
备注
NeurIPS 2024