重尾赌博机中的 $(\epsilon, u)$-自适应后悔最小化
机器学习
2024-02-13 v2 人工智能
摘要
重尾分布在从金融到电信的多种场景中自然出现。尽管在次高斯或有界奖励下的后悔最小化已被广泛研究,带有重尾分布的学习仅在近十年才受到关注。在本文中,我们考虑奖励分布具有最大阶数 的有限绝对原始矩、且一致由常数 界定的设定,其中 。在此设定下,我们研究当 和 对学习者未知且必须自适应时的后悔最小化问题。首先,我们表明自适应是有代价的,并推导了两个负面结果,证明在无进一步假设时无法达到非自适应情形的相同后悔保证。随后,我们设计并分析了一种完全数据驱动的截断均值估计器,并提出了一种利用该估计器的新型自适应后悔最小化算法 AdaR-UCB。最后,我们表明 AdaR-UCB 是在已知分布假设下首个享有近乎匹配非自适应重尾情形后悔保证的算法。
引用
@article{arxiv.2310.02975,
title = {$(\epsilon, u)$-Adaptive Regret Minimization in Heavy-Tailed Bandits},
author = {Gianmarco Genalti and Lupo Marsigli and Nicola Gatti and Alberto Maria Metelli},
journal= {arXiv preprint arXiv:2310.02975},
year = {2024}
}