中文

具有重尾收益的随机线性_bandit的近最优后悔界

机器学习 2020-04-29 v1 机器学习

摘要

本文研究具有有限动作集的随机线性 bandit 问题。现有工作多假设收益有界或次高斯,这在某些场景(如金融市场)中可能不成立。为解决该问题,我们分析了具有重尾收益的线性 bandit,其中收益对某些 ϵ(0,1]\epsilon\in(0,1] 存在有限 1+ϵ1+\epsilon 阶矩。通过均值的中位数与动态截断,我们提出两种新颖算法,其享有 O~(d12T11+ϵ)\widetilde{O}(d^{\frac{1}{2}}T^{\frac{1}{1+\epsilon}}) 的次线性后悔界,其中 dd 为上下文信息维度,TT 为时间范围。同时,我们给出 Ω(dϵ1+ϵT11+ϵ)\Omega(d^{\frac{\epsilon}{1+\epsilon}}T^{\frac{1}{1+\epsilon}}) 下界,这意味着当 ϵ=1\epsilon=1 时,我们的上界在 ddTT 的 polylogarithmic 因子意义上与下界匹配。最后,我们进行数值实验以证明算法的有效性,实证结果有力支持了我们的理论保证。

关键词

引用

@article{arxiv.2004.13465,
  title  = {Nearly Optimal Regret for Stochastic Linear Bandits with Heavy-Tailed Payoffs},
  author = {Bo Xue and Guanghui Wang and Yimu Wang and Lijun Zhang},
  journal= {arXiv preprint arXiv:2004.13465},
  year   = {2020}
}