中文

重尾收益线性随机_bandit的近乎最优算法

机器学习 2018-11-13 v2 机器学习

摘要

在线性随机 bandit 中,通常假设收益带有次高斯噪声。本文在较弱的噪声假设下,研究具有重尾收益(LinBET)的线性随机 bandit 问题,其中分布具有阶数 1+ϵ1+\epsilon 的有限矩,对某些 ϵ(0,1]\epsilon\in (0,1]。我们严格分析 LinBET 的悔下界为 Ω(T11+ϵ)\Omega(T^{\frac{1}{1+\epsilon}}),意味着 2 阶有限矩(即有限方差)给出 Ω(T)\Omega(\sqrt{T}) 的界,其中 TT 为玩 bandit 的总轮数。所给下界还表明,当前 LinBET 的 SOTA 算法远非最优。通过采用均值的中位数并配合精心设计的决策分配与基于历史信息的截断,我们开发了两种新颖的 bandit 算法,其悔上界与下界仅相差多对数因子。据我们所知,我们首次在 TT 的多项式阶意义上最优地解决了 LinBET。我们基于合成数据集评估了所提算法,其优于 SOTA 结果。

关键词

引用

@article{arxiv.1810.10895,
  title  = {Almost Optimal Algorithms for Linear Stochastic Bandits with Heavy-Tailed Payoffs},
  author = {Han Shao and Xiaotian Yu and Irwin King and Michael R. Lyu},
  journal= {arXiv preprint arXiv:1810.10895},
  year   = {2018}
}