中文

面向上下文老虎机的朗之万蒙特卡洛方法

机器学习 2022-06-23 v1 机器学习

摘要

我们研究上下文老虎机中 Thompson 采样的效率。现有的基于 Thompson 采样的算法需要构造后验分布的拉普拉斯近似(即高斯分布),这对于一般协方差矩阵的高维应用而言采样效率低下。此外,对于一般的奖励生成函数,高斯近似可能不是后验分布的良好替代。我们提出了一种高效的后验采样算法,即朗之万蒙特卡洛 Thompson 采样 (LMC-TS),其使用马尔可夫链蒙特卡洛 (MCMC) 方法直接从上下文老虎机的后验分布中采样。我们的方法计算高效,因为只需执行带噪声的梯度下降更新,而无需构造后验分布的拉普拉斯近似。我们证明所提算法在上下文老虎机的一个特例即线性上下文老虎机上,达到了与最佳 Thompson 采样算法相同的次线性后悔界。我们在不同上下文老虎机模型的合成数据与真实世界数据集上进行了实验,表明直接从后验采样既计算高效又具有竞争力的性能。

关键词

引用

@article{arxiv.2206.11254,
  title  = {Langevin Monte Carlo for Contextual Bandits},
  author = {Pan Xu and Hongkai Zheng and Eric Mazumdar and Kamyar Azizzadenesheli and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2206.11254},
  year   = {2022}
}

备注

21 pages, 3 figures, 2 tables. To appear in the proceedings of the 39th International Conference on Machine Learning (ICML2022)