级联_bandit的汤普森采样算法
机器学习
2021-05-18 v4 机器学习
摘要
受在线推荐系统中高效优化的迫切需求驱动,我们重新审视 Kveton 等人(2015)提出的级联 bandit 模型。尽管汤普森采样(TS)算法在级联 bandit 上已被证明优于上置信界(UCB)算法,但理论保证仅对后者已知。本文中,我们首先给出具有 Beta-Bernoulli 更新的 TS 算法的依赖于问题的后悔上界;该上界比 Huyuk 与 Tekin(2019)在更一般设定下近期推导的结果更紧。接着,我们设计并分析另一种具有高斯更新的 TS 算法,TS-Cascade。TS-Cascade 达到了级联 bandit 的最优后悔界。作为补充,我们考虑级联 bandit 模型的线性推广,其允许在大型级联 bandit 问题实例中高效学习。我们引入并分析了一种 TS 算法,其后悔界依赖于线性模型的维度而非物品数量。最后,通过利用信息论技术并审慎构造级联 bandit 实例,我们推导了标准模型下近乎匹配的后悔下界。我们的论文建立了针对具有部分反馈的随机组合 bandit 问题模型的 TS 算法的首批理论保证。数值实验证明了所提 TS 算法相较现有基于 UCB 算法的优越性。
引用
@article{arxiv.1810.01187,
title = {Thompson Sampling Algorithms for Cascading Bandits},
author = {Zixin Zhong and Wang Chi Cheung and Vincent Y. F. Tan},
journal= {arXiv preprint arXiv:1810.01187},
year = {2021}
}
备注
62 pages, 6 figures