最优多臂偏置算法的 regret tail 特性分析
信息论
2026-04-17 v1 机器学习
math.IT
摘要
我们研究了随机多臂偏置中算法 regret 尾部行为。虽然最小化期望 regret 是经典目标,但最近的工作表明,即使是此类算法也可能出现较重的 regret 尾部,在非零概率下会产生较大的 regret。现有的 regret tail 精细表征主要局限于参数化设置,如单参数指数族。在本工作中,我们将 -UCB 算法推广到一个广泛的非参数化奖励分布类,满足轻度假设,并在期望上建立其渐近最优性。随后,我们分析其 regret 的尾部行为,推导了其 regret tail 概率的新颖上界。作为特殊情况,我们的结果在封闭支持和重尾(矩受限)偏置模型中恢复了 regret tail 保证。此外,对于有限支持奖励分布的特殊情况,我们的上界恰好匹配已知的下界。我们的结果因此为渐进最优基于 KL 的 UCB 算法提供了统一且紧密的 regret tail 表征,超越了参数化模型。
引用
@article{arxiv.2604.14876,
title = {Regret Tail Characterization of Optimal Bandit Algorithms with Generic Rewards},
author = {Subhodip Panda and Shubhada Agrawal},
journal= {arXiv preprint arXiv:2604.14876},
year = {2026}
}