关于随机多臂老虎机的仿射式分位数分析
机器学习
2026-05-11 v1 机器学习
摘要
随机多臂老虎机算法通常在均值奖励标准下进行分析,但许多问题更倾向于选择上尾性能强的臂位,我们在此进行研究。对于固定的 miscoverage 水平 ,臂 的自然上尾目标是中心预测区间的上端点 。该目标可能因均值不同而导致臂位排序不同,与经典多臂老虎机目标形成中心性不匹配。为此,我们提出 ACP-UCB1,一种结合自适应仿射上端点估计与 UCB 类型乐观奖励的策略。技术挑战在于,ACP-UCB1 使用的仿射得分是从不断演化的经验分位数估计中重新计算的,并在自适应水平下进行评估。我们通过奖励分位数浓度、重新计算得分分位数的扰动论证以及自适应水平的确定性局部化来控制该端点。ACP-UCB1 实现了具有每臂贡献 的对数上尾 regret。我们还提供特定于度量的 regret 分解,比较 ACP-UCB1 与 UCB1,并通过数值实验验证性能和改进。
引用
@article{arxiv.2605.07115,
title = {Conformal-Style Quantile Analyses for Stochastic Bandits},
author = {Chengyu Du and Mengfan Xu},
journal= {arXiv preprint arXiv:2605.07115},
year = {2026}
}