中文

具有重尾奖励的广义线性Bandit的高效算法

机器学习 2023-10-31 v1

摘要

本文研究了具有重尾奖励的广义线性Bandit问题,其(1+ϵ)(1+\epsilon)阶矩有界,其中ϵ(0,1]\epsilon\in (0,1]。尽管存在针对广义线性Bandit的方法,但大多数聚焦于有界或次高斯奖励,并不适用于许多真实场景,如金融市场和网页广告。为解决此问题,我们提出了两种基于截断和中位数均值的新算法。这些算法实现了O~(dT11+ϵ)\widetilde{O}(dT^{\frac{1}{1+\epsilon}})的近乎最优后悔界,其中dd为上下文信息的维度,TT为时间范围。我们基于截断的算法支持在线学习,这使其区别于现有的基于截断的方法。此外,我们基于中位数均值的算法每个周期仅需O(logT)O(\log T)个奖励和一个估计器,更具实用性。而且,当ϵ=1\epsilon=1时,我们的算法相比现有算法将后悔界改进了一个对数因子。数值实验结果证实了我们所提算法的优点。

关键词

引用

@article{arxiv.2310.18701,
  title  = {Efficient Algorithms for Generalized Linear Bandits with Heavy-tailed Rewards},
  author = {Bo Xue and Yimu Wang and Yuanyu Wan and Jinfeng Yi and Lijun Zhang},
  journal= {arXiv preprint arXiv:2310.18701},
  year   = {2023}
}