中文

随机线性bandit中的扰动历史探索

机器学习 2023-07-12 v2 机器学习

摘要

我们提出一种用于随机线性bandit中累积后悔最小化的新在线算法。该算法在其扰动历史上训练得到的线性模型中,选取估计奖励最高的臂。因此,我们称之为线性bandit中的扰动历史探索(LinPHE)。扰动历史是观测奖励与随机生成的独立同分布伪奖励的混合。我们推导出LinPHE在nn轮后悔上的O~(dn)\tilde{O}(d \sqrt{n})无间隙界,其中dd为特征数。我们分析中的关键步骤是关于伯努利随机变量加权和的新集中界与反集中界。为展示我们设计的通用性,我们将LinPHE推广到logistic模型。我们从经验上评估了算法,表明其实用。

关键词

引用

@article{arxiv.1903.09132,
  title  = {Perturbed-History Exploration in Stochastic Linear Bandits},
  author = {Branislav Kveton and Csaba Szepesvari and Mohammad Ghavamzadeh and Craig Boutilier},
  journal= {arXiv preprint arXiv:1903.09132},
  year   = {2023}
}

备注

Proceedings of the 35th Conference on Uncertainty in Artificial Intelligence