打破 $\sqrt{T}$ 壁垒:随机上下文线性 Bandit 的实例无关对数后悔
机器学习
2022-05-23 v1 人工智能
信息论
机器学习
math.IT
摘要
我们证明了具有线性收益的随机上下文 Bandit 的实例无关(多项式)对数后悔。此前,在 \cite{chu2011contextual} 中,针对任意(对抗性选择)上下文的上下文线性 Bandit 问题给出了 的下界。本文中,我们表明随机上下文确实有助于将后悔从 降至 。我们提出低后悔随机上下文 Bandit(\texttt{LR-SCB}),其利用随机上下文并同时进行参数估计(以 范数)与后悔最小化。\texttt{LR-SCB} 以 epoch 方式工作,其中上一 epoch 的参数估计用于降低当前 epoch 的后悔。\texttt{LR-SCB} 的(多项式)对数后悔源于两个关键事实:(a) 应用范数自适应算法以利用参数估计;(b) 对偏移线性上下文 Bandit 算法的分析,表明偏移会导致后悔增加。我们还通过实验表明,随机上下文确实产生了随 缩放的后悔。
引用
@article{arxiv.2205.09899,
title = {Breaking the $\sqrt{T}$ Barrier: Instance-Independent Logarithmic Regret in Stochastic Contextual Linear Bandits},
author = {Avishek Ghosh and Abishek Sankararaman},
journal= {arXiv preprint arXiv:2205.09899},
year = {2022}
}
备注
To appear in ICML 2022