中文

用于上下文赌博机的Feel-Good汤普森采样:一场马尔可夫链蒙特卡洛对决

机器学习 2025-10-27 v3

摘要

汤普森采样(TS)被广泛用于解决上下文赌博机中的探索/利用权衡问题,然而近期的理论表明,在高维问题中它探索得不够积极。Feel-Good汤普森采样(FG-TS)通过添加一个偏向高奖励模型的乐观奖励来解决这个问题,并且在后验精确的线性设置中实现了渐近极小化最优遗憾。然而,其在使用近似后验(在大规模或神经问题中常见)时的性能尚未被基准测试。我们首次对FG-TS及其平滑变体(SFG-TS)在11个真实世界和合成基准上进行了系统研究。为了评估其鲁棒性,我们比较了在精确后验设置(线性和逻辑赌博机)与由快速但粗糙的随机梯度采样器产生的近似机制下的性能。对预处理、奖励尺度和先验强度的消融实验揭示了一个权衡:当后验样本准确时,较大的奖励有帮助,但当采样噪声占主导时则有害。FG-TS在线性和逻辑赌博机中通常优于标准TS,但在神经赌博机中往往较弱。尽管如此,由于FG-TS及其变体具有竞争性且易于使用,我们推荐将它们作为现代上下文赌博机基准中的基线。最后,我们在https://github.com/SarahLiaw/ctx-bandits-mcmc-showdown提供了所有实验的源代码。

关键词

引用

@article{arxiv.2507.15290,
  title  = {Feel-Good Thompson Sampling for Contextual Bandits: a Markov Chain Monte Carlo Showdown},
  author = {Emile Anand and Sarah Liaw},
  journal= {arXiv preprint arXiv:2507.15290},
  year   = {2025}
}

备注

41 pages. Accepted at NeurIPS 2025