重尾_bandit_的极小极大策略
机器学习
2020-11-19 v2 机器学习
摘要
我们在最坏情况后悔与重尾奖励分布下研究随机多臂_bandit_(MAB)问题。我们通过使用饱和经验均值修改针对次高斯奖励分布的极小极大策略 MOSS,设计出一种称为 Robust MOSS 的新算法。我们表明,若奖励分布的 阶矩存在,则该精炼策略的最坏情况后悔与下界匹配,同时保持依赖于分布的对数后悔。
引用
@article{arxiv.2007.10493,
title = {Minimax Policy for Heavy-tailed Bandits},
author = {Lai Wei and Vaibhav Srivastava},
journal= {arXiv preprint arXiv:2007.10493},
year = {2020}
}