中文

打破 $\sqrt{T}$ 壁垒:随机上下文线性 Bandit 的实例无关对数后悔

机器学习 2022-05-23 v1 人工智能 信息论 机器学习 math.IT

摘要

我们证明了具有线性收益的随机上下文 Bandit 的实例无关(多项式)对数后悔。此前,在 \cite{chu2011contextual} 中,针对任意(对抗性选择)上下文的上下文线性 Bandit 问题给出了 O(T)\mathcal{O}(\sqrt{T}) 的下界。本文中,我们表明随机上下文确实有助于将后悔从 T\sqrt{T} 降至 \polylog(T)\polylog(T)。我们提出低后悔随机上下文 Bandit(\texttt{LR-SCB}),其利用随机上下文并同时进行参数估计(以 2\ell_2 范数)与后悔最小化。\texttt{LR-SCB} 以 epoch 方式工作,其中上一 epoch 的参数估计用于降低当前 epoch 的后悔。\texttt{LR-SCB} 的(多项式)对数后悔源于两个关键事实:(a) 应用范数自适应算法以利用参数估计;(b) 对偏移线性上下文 Bandit 算法的分析,表明偏移会导致后悔增加。我们还通过实验表明,随机上下文确实产生了随 \polylog(T)\polylog(T) 缩放的后悔。

关键词

引用

@article{arxiv.2205.09899,
  title  = {Breaking the $\sqrt{T}$ Barrier: Instance-Independent Logarithmic Regret in Stochastic Contextual Linear Bandits},
  author = {Avishek Ghosh and Abishek Sankararaman},
  journal= {arXiv preprint arXiv:2205.09899},
  year   = {2022}
}

备注

To appear in ICML 2022