中文

从随机逼近视角重新思考 Langevin 采样中的 Thompson 采样

机器学习 2025-10-07 v1 人工智能 机器学习

摘要

大多数现有的近似 Thompson 采样 (TS) 算法用于多臂老板问题,使用随机梯度 Langevin 动力学 (SGLD) 或其变体在每个轮次中对后验进行采样,从而放宽了先验与奖励分布之间共轰假设的需求。然而,它们通常需要在不同轮次中逼近不同的后验分布。这需要对诸如动态学习率等超参数进行棘手的、轮次特定的调谐,这在理论分析和实际实现中都具有挑战性。为缓解这种非平稳性,我们引入了 TS-SA,它将随机逼近 (SA) 纳入 TS 框架。在每个轮次中,TS-SA仅使用最新奖励(s)构建后验近似,执行 Langevin 蒙特卡洌 (LMC) 更新,并对时间上的噪声提议进行 SA 步骤以进行平均。这可以解释为 throughout the entire algorithm 近似一个平稳后验目标,从而获得固定步长、统一的收敛分析框架以及通过时间平均改进的后验估计。我们为 TS-SA 建立了近最优的 regret 界,通过将整个算法解释为平稳 SGLD 过程的仿真,实现了简化且更直观的理论分析。我们的实验结果表明,即使只进行一次 Langevin 更新且经过 certain warm-up,也在老板任务中显著优于现有方法。

关键词

引用

@article{arxiv.2510.05023,
  title  = {Rethinking Langevin Thompson Sampling from A Stochastic Approximation Perspective},
  author = {Weixin Wang and Haoyang Zheng and Guang Lin and Wei Deng and Pan Xu},
  journal= {arXiv preprint arXiv:2510.05023},
  year   = {2025}
}

备注

39 pages, 3 figures, 2 tables