方差感知 UCB 的精确渐近与细化后悔
机器学习
2025-02-18 v2 机器学习
统计理论
统计理论
摘要
本文研究了针对多臂老虎机(MAB)问题的上置置信界-方差(UCB-V)算法行为。更准确地说,我们对 UCB-V 的臂拉取率进行渐近特征描述,扩展了 Kalvit 和 Zeevi (2021) 以及 Khamaru 和 Zhang (2024) 最近关于标准 UCB 的结果。在与标准 UCB 不同之处,我们分析表明,UCB-V 的行为可能不稳定,即臂拉取率可能并非始终渐近确定。除了渐近特征描述之外,我们还提供了在高概率下臂拉取率的非渐近界,为后悔分析提供了见解。作为该高概率结果的应用,我们证明 UCB-V 能够实现更细化的后悔界,这是以前未知的,即使对于更复杂和更先进的方差感知在线决策算法也是如此。
引用
@article{arxiv.2412.08843,
title = {Precise Asymptotics and Refined Regret of Variance-Aware UCB},
author = {Yingying Fan and Yuxuan Han and Jinchi Lv and Xiaocong Xu and Zhengyuan Zhou},
journal= {arXiv preprint arXiv:2412.08843},
year = {2025}
}