打破矩条件壁垒:面向超重尾收益赌博机问题的无后悔算法
机器学习
2021-10-27 v1
摘要
尽管在机器学习中处理重尾误差方面已有大量努力,但当误差的矩可能不存在时却鲜为人知:随机噪声 满足 Pr 对某个 。我们首次尝试在赌博机学习问题中主动处理此类超重尾噪声:我们提出了一种新颖的鲁棒统计估计器,中位数均值,其通过计算每个经验中位数的经验均值来估计随机变量。然后我们提出一个通用的归约算法框架用于解决赌博机学习问题(包括多臂和线性赌博机问题):中位数均值估计器可作为黑盒滤波器应用于几乎所有赌博机学习算法以过滤其奖励信号,并获得与奖励为次高斯时相似的后悔界。我们证明了即使在极重尾噪声下后悔界也是近最优的。我们还通过实验证明了所提算法的有效性,进一步佐证了我们的理论结果。
引用
@article{arxiv.2110.13876,
title = {Breaking the Moments Condition Barrier: No-Regret Algorithm for Bandits with Super Heavy-Tailed Payoffs},
author = {Han Zhong and Jiayi Huang and Lin F. Yang and Liwei Wang},
journal= {arXiv preprint arXiv:2110.13876},
year = {2021}
}
备注
NeurIPS 2021