具有已知时限的上升多臂老虎机
机器学习
2026-02-16 v2
摘要
上升多臂老虎机(RMAB)框架模型化了手段期望奖励随着尝试次数递增的环境,这种情形可用于机器人学和超参数调谐等实际场景。例如,在超参数调谐中,模型配置(手段)的验证准确率通常随每个训练周期而递增。RMAB 的一个定义性特征是时限相关的最优性:与标准设置不同,此处的最优策略会因可用预算 的不同而发生显著变化。这意味着对 的知识在 RMAB 中提供了显著更大的效用,使学习者能够与这种时限相关的动态最优性相协调。然而,时限感知的设置仍未得到充分探索。为此,我们提出了一种 novel 的 CUmulative Reward Estimation UCB(CURE-UCB)算法,显式地整合了时限。我们提供了严格的分析,建立了新的警戒上界,并证明该方法在诸如“线性后平坦”实例等结构化环境中严格优于时限不可感知策略。大量实验表明,其在基线方法上的显著优势。
引用
@article{arxiv.2602.10727,
title = {Rising Multi-Armed Bandits with Known Horizons},
author = {Seockbean Song and Chenyu Gan and Youngsik Yoon and Siwei Wang and Wei Chen and Jungseul Ok},
journal= {arXiv preprint arXiv:2602.10727},
year = {2026}
}