具有重尾奖励的广义线性Bandit的高效算法
机器学习
2023-10-31 v1
摘要
本文研究了具有重尾奖励的广义线性Bandit问题,其阶矩有界,其中。尽管存在针对广义线性Bandit的方法,但大多数聚焦于有界或次高斯奖励,并不适用于许多真实场景,如金融市场和网页广告。为解决此问题,我们提出了两种基于截断和中位数均值的新算法。这些算法实现了的近乎最优后悔界,其中为上下文信息的维度,为时间范围。我们基于截断的算法支持在线学习,这使其区别于现有的基于截断的方法。此外,我们基于中位数均值的算法每个周期仅需个奖励和一个估计器,更具实用性。而且,当时,我们的算法相比现有算法将后悔界改进了一个对数因子。数值实验结果证实了我们所提算法的优点。
引用
@article{arxiv.2310.18701,
title = {Efficient Algorithms for Generalized Linear Bandits with Heavy-tailed Rewards},
author = {Bo Xue and Yimu Wang and Yuanyu Wan and Jinfeng Yi and Lijun Zhang},
journal= {arXiv preprint arXiv:2310.18701},
year = {2023}
}