VITS:用于上下文老虎机的变分推断汤普森采样
机器学习
2024-07-23 v4 机器学习
摘要
在本文中,我们介绍并分析了一种用于上下文老虎机(contextual bandits)的汤普森采样(TS)算法变体。在每一轮中,传统 TS 需要从当前后验分布中采样,而这通常是难处理的。为规避此问题,可使用近似推断技术并提供接近后验分布的样本。然而,现有近似技术要么估计较差(拉普拉斯近似),要么计算开销大(MCMC 方法、集成采样等)。本文中,我们提出一种新算法——基于高斯变分推断的变分推断汤普森采样 VITS。该方案提供了易于采样且计算高效的有力后验近似,使其成为 TS 的理想选择。此外,我们证明 VITS 在线性上下文老虎机上取得了与传统 TS 同阶关于维数与轮次数的次线性后悔界。最后,我们在合成与真实世界数据集上通过实验证明了 VITS 的有效性。
引用
@article{arxiv.2307.10167,
title = {VITS : Variational Inference Thompson Sampling for contextual bandits},
author = {Pierre Clavier and Tom Huix and Alain Durmus},
journal= {arXiv preprint arXiv:2307.10167},
year = {2024}
}