具有重尾收益的随机线性_bandit的近最优后悔界
机器学习
2020-04-29 v1 机器学习
摘要
本文研究具有有限动作集的随机线性 bandit 问题。现有工作多假设收益有界或次高斯,这在某些场景(如金融市场)中可能不成立。为解决该问题,我们分析了具有重尾收益的线性 bandit,其中收益对某些 存在有限 阶矩。通过均值的中位数与动态截断,我们提出两种新颖算法,其享有 的次线性后悔界,其中 为上下文信息维度, 为时间范围。同时,我们给出 下界,这意味着当 时,我们的上界在 与 的 polylogarithmic 因子意义上与下界匹配。最后,我们进行数值实验以证明算法的有效性,实证结果有力支持了我们的理论保证。
引用
@article{arxiv.2004.13465,
title = {Nearly Optimal Regret for Stochastic Linear Bandits with Heavy-Tailed Payoffs},
author = {Bo Xue and Guanghui Wang and Yimu Wang and Lijun Zhang},
journal= {arXiv preprint arXiv:2004.13465},
year = {2020}
}