中文

方差如何塑造情境型多臂老虎机的后悔值?

机器学习 2024-11-28 v2 机器学习

摘要

我们考虑可实现的情境型多臂老虎机(contextual bandits),使用一般函数逼近,研究小奖励方差如何导致优于最小混沌后悔值界限。与混沌界限不同,我们表明,贪欲维数delud_\text{elu}——一种函数类的复杂度度量——在方差相关的界限中发挥关键作用。我们考虑两种类型的对手:(1)弱对手:对手在观察学习者的动作之前设置奖励方差。在这种设置下,我们证明当deluATd_{\text{elu}}\leq\sqrt{AT}时,奖励为Ω(min{A,delu}Λ+delu)\Omega(\sqrt{\min\{A,d_\text{elu}\}\Lambda}+d_\text{elu})是不可避免的,其中AA是动作的数量,TT是总轮数,Λ\LambdaTT轮的总方差。对于AdeluA\leq d_\text{elu}的情形,我们推导出在方差在每个轮次开始时披露的特殊情况下, nearly matching 上界O~(AΛ+delu)\tilde{O}(\sqrt{A\Lambda}+d_\text{elu})。(2)强对手:对手在观察学习者的动作后设置奖励方差。在这种设置下,我们证明当deluΛ+deluAT\sqrt{d_\text{elu}\Lambda}+d_\text{elu}\leq\sqrt{AT}时,奖励为Ω(deluΛ+delu)\Omega(\sqrt{d_\text{elu}\Lambda}+d_\text{elu})是不可避免的。在这种设置下,我们提供了阶O~(deluΛ+delu)\tilde{O}(d_\text{elu}\sqrt{\Lambda}+d_\text{elu})的上界。此外,我们检查了函数类额外提供奖励分布信息的设置,正如Wang等人(2024)所研究的那样。我们证明其工作中建立的后悔值界限O~(deluΛ+delu)\tilde{O}(\sqrt{d_\text{elu}\Lambda}+d_\text{elu})deluΛ+deluAT\sqrt{d_{\text{elu}}\Lambda}+d_\text{elu}\leq\sqrt{AT}时是不可改进的。然而,采用略微不同的总方差定义,并假设奖励服从正态分布后,可实现后悔值O~(AΛ+delu)\tilde{O}(\sqrt{A\Lambda}+d_\text{elu})

关键词

引用

@article{arxiv.2410.12713,
  title  = {How Does Variance Shape the Regret in Contextual Bandits?},
  author = {Zeyu Jia and Jian Qian and Alexander Rakhlin and Chen-Yu Wei},
  journal= {arXiv preprint arXiv:2410.12713},
  year   = {2024}
}

备注

NeurIPS 2024