中文

具有已知时限的上升多臂老虎机

机器学习 2026-02-16 v2

摘要

上升多臂老虎机(RMAB)框架模型化了手段期望奖励随着尝试次数递增的环境,这种情形可用于机器人学和超参数调谐等实际场景。例如,在超参数调谐中,模型配置(手段)的验证准确率通常随每个训练周期而递增。RMAB 的一个定义性特征是时限相关的最优性:与标准设置不同,此处的最优策略会因可用预算 TT 的不同而发生显著变化。这意味着对 TT 的知识在 RMAB 中提供了显著更大的效用,使学习者能够与这种时限相关的动态最优性相协调。然而,时限感知的设置仍未得到充分探索。为此,我们提出了一种 novel 的 CUmulative Reward Estimation UCB(CURE-UCB)算法,显式地整合了时限。我们提供了严格的分析,建立了新的警戒上界,并证明该方法在诸如“线性后平坦”实例等结构化环境中严格优于时限不可感知策略。大量实验表明,其在基线方法上的显著优势。

关键词

引用

@article{arxiv.2602.10727,
  title  = {Rising Multi-Armed Bandits with Known Horizons},
  author = {Seockbean Song and Chenyu Gan and Youngsik Yoon and Siwei Wang and Wei Chen and Jungseul Ok},
  journal= {arXiv preprint arXiv:2602.10727},
  year   = {2026}
}