中文

组合升华型多臂盒子

机器学习 2026-03-04 v4 机器学习

摘要

组合在线学习是选择最优动作(或超臂)作为基臂组合的基本任务,适用于与提供随机奖励的系统进行的顺序交互。其应用领域涵盖机器人、社交广告、网络路由和推荐系统等。在许多实际场景中,我们常遇到递增奖励的情况,即演练某个基臂不仅提供即时奖励,还导致未来奖励增强,例如机器人通过练习提升,社交影响在成功推荐历史中加强。关键在于,这些增强可能传播到共享相同基臂的多个超臂,引入超出现有盒子模型范围的依赖关系。为解决这一问题,我们引入了组合升华盒子(CRB)框架,提出了具备可证明效率和实际效果的算法——组合升华上置信上界(CRUCB)。我们在真实的深度强化学习环境和合成设置中实证展示了 CRUCB 的有效性,而理论分析则建立了紧密的 regret 上界。二者共同凸显了该方法在实际影响和理论严谨性方面的意义。我们的代码已在 https://github.com/ml-postech/Combinatorial-Rising-Bandits 上提供。

关键词

引用

@article{arxiv.2412.00798,
  title  = {Combinatorial Rising Bandits},
  author = {Seockbean Song and Youngsik Yoon and Siwei Wang and Wei Chen and Jungseul Ok},
  journal= {arXiv preprint arXiv:2412.00798},
  year   = {2026}
}