重试感知型多臂老虎机的有限时序差额分析
机器学习
2026-05-21 v1
摘要
我们研究一种受重试感知目标启发的随机多臂老虎机算法,这类目标重视多次尝试中最佳的结果,如 pass@ 和 max@。给定臂价值的后验分布,ReMax 选择一种抽样分布,以最大化 次虚拟抽样所得的最大奖励的后验期望。虽然该目标最初在强化学习中作为不确定性下的探索机制被提出,但在老虎机问题中的差额性质仍不明确。对于高斯奖励且第一个非平凡情形 ,我们通过期望改进平衡条件刻画 ReMax 的最优抽样分布,并证明了 ReMax 的第一个亚线性差额上界。我们的分析将次优臂的常规饱和行为与 ReMax 特有的低估效应分开,后者指在不利估计后,最优臂可能被抽样得过于稀少。这解释了为何 ReMax 比 Thompson 抽样更具攻击性,以及其差额分析为何在技术上极其精细。实验支持了这一认识:在轻度低估情况下,ReMax 常常优于 KL-UCB 和 Thompson 抽样,而后验方差缩放经验上可缓解严重的低估。
关键词
引用
@article{arxiv.2605.20854,
title = {Finite-Time Regret Analysis of Retry-Aware Bandits},
author = {Bingkui Tong and Junpei Komiyama and Soichiro Nishimori and Paavo Parmas},
journal= {arXiv preprint arXiv:2605.20854},
year = {2026}
}
备注
38 pages