TS-UCB:以极少或不增加计算量改进 Thompson 采样
机器学习
2021-05-05 v2 机器学习
摘要
Thompson 采样已成为具有 bandit 反馈的在线决策问题中一种普遍的方法。Thompson 采样的关键算法任务是从最优动作的后验中抽样。我们提出一种称为 TS-UCB 的替代臂选择规则,其所需额外计算代价可忽略,却相对 Thompson 采样带来显著的性能提升。在每一步,TS-UCB 使用两种成分计算每个臂的得分:后验样本与上置信界。TS-UCB 可用于任何这两者可用的场景,且对输入的后验样本数量具有灵活性。TS-UCB 在一套综合的合成与真实世界数据集上实现了实质更低的 regret,包括来自 Yahoo! 的个性化文章推荐数据集以及 Riquelme 等人(2018)提出的深度 bandit 套件中的一组基准数据集。最后,从理论角度,我们为 TS-UCB 建立了 K-臂与线性 bandit 模型下的最优 regret 保证。
引用
@article{arxiv.2006.06372,
title = {TS-UCB: Improving on Thompson Sampling With Little to No Additional Computation},
author = {Jackie Baek and Vivek F. Farias},
journal= {arXiv preprint arXiv:2006.06372},
year = {2021}
}