小间隙机制下 Thompson 采样的扩散逼近
机器学习
2026-04-23 v6 统计理论
统计理论
摘要
我们研究 Thompson 采样及相关的基于采样的 bandit 算法在“小间隙”机制下的过程级动态,其中臂均值之间的间隙为 量级或更小,时间范围为 量级,且 。在此机制下,当 时,我们证明此类算法的过程级动态弱收敛于某些随机微分方程与随机常微分方程的解。我们的弱收敛理论利用连续映射定理发展而来,提供了一种直接且模块化的理论方法,可适用于分析多种基于采样的 bandit 算法并处理弱相关奖励过程。一个核心发现是算法不变性原理:在小间隙机制下,一大类基于采样的算法的极限动态——包括具有一般单参数指数族似然的 Thompson 采样,以及基于 bootstrap 重采样的非参数 bandit 算法——均与具有高斯似然的 Thompson 采样的极限动态一致。此外,在小间隙机制下,这些算法的后悔性能通常对模型误设不敏感,并随误设程度的增加而连续变化。
引用
@article{arxiv.2105.09232,
title = {Diffusion Approximations for Thompson Sampling in the Small Gap Regime},
author = {Lin Fan and Peter W. Glynn},
journal= {arXiv preprint arXiv:2105.09232},
year = {2026}
}