中文

具有重尾奖励的随机多臂老虎机的优化算法

机器学习 2021-10-28 v2 机器学习

摘要

本文考虑奖励具有重尾特性的随机多臂老虎机(MAB),其 pp 阶矩以常数 νp\nu_{p} 为界(1<p21<p\leq2)。首先,我们提出一种新颖的鲁棒估计器,其不需要将 νp\nu_{p} 作为先验信息,而现有其他鲁棒估计器均要求关于 νp\nu_{p} 的先验知识。我们证明了所提估计器的误差概率呈指数级快速衰减。利用该估计器,我们提出一种基于扰动的探索策略,并发展了广义后悔分析框架,通过揭示后悔与扰动累积分布函数之间的关系,给出上、下后悔界。基于所提分析框架,我们获得了多种扰动下依赖于间隙与独立于间隙的上、下后悔界。我们还找到了每种扰动的最优超参数,其可关于总轮数达到极小极大最优后悔界。在仿真中,相较于现有鲁棒估计器,所提估计器在各种 pp 值下均表现出良好性能;且在 MAB 问题中,所提扰动策略优于现有探索方法。

关键词

引用

@article{arxiv.2010.12866,
  title  = {Optimal Algorithms for Stochastic Multi-Armed Bandits with Heavy Tailed Rewards},
  author = {Kyungjae Lee and Hongjun Yang and Sungbin Lim and Songhwai Oh},
  journal= {arXiv preprint arXiv:2010.12866},
  year   = {2021}
}

备注

38 pages, 4 figures. Accepted for NeurIPS 2020