多参数老虎机模型中 Thompson 采样非信息先验的选择
机器学习
2023-12-14 v2 统计理论
机器学习
统计理论
摘要
Thompson 采样(TS)以其卓越的实证性能著称,并在经典随机多臂老虎机问题的各类奖励模型下得到理论保证的支持。然而,其最优性常限于特定先验,因为普遍观察到 TS 对先验选择在渐近后悔界上相当不敏感。但当模型含多个参数时,TS 的最优性高度依赖先验选择,这使既往发现向其他模型的泛化性存疑。为弥补此缺口,本研究探讨选择非信息先验的影响,为处理缺乏理论理解的新模型时 TS 的表现提供见解。我们首先将 TS 的后悔分析扩展至具有未知支撑的均匀分布模型,此为最简单的非正则模型。我们发现,改变非信息先验可显著影响期望后悔,与既往其他多参数老虎机模型中的已知结果一致。尽管均匀先验被证明最优,我们强调其最优性固有的局限:仅限于特定参数化,并凸显先验不变性的重要。有鉴于此局限,我们提出一种稍作修改的基于 TS 的策略,称为带截断的 Thompson 采样(TS-T),其通过使用在双射重参数化下不变的参考先验与 Jeffreys 先验,可对高斯模型与均匀模型实现渐近最优。该策略通过采用精细截断实现最优性,在实践中远比寻找最优先验容易。
引用
@article{arxiv.2302.14407,
title = {The Choice of Noninformative Priors for Thompson Sampling in Multiparameter Bandit Models},
author = {Jongyeong Lee and Chao-Kai Chiang and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2302.14407},
year = {2023}
}
备注
55 pages, TBA AAAI2024