使用无信息先验的 Thompson 采样在 Pareto 赌博机中的最优性
机器学习
2023-02-06 v1 统计理论
机器学习
统计理论
摘要
在随机多臂赌博机问题中,一种称为 Thompson 采样(TS)的随机化概率匹配策略已在多种奖励模型中展现出优异性能。除经验性能外,TS 已被证明在若干模型中达到渐近问题依赖下界。然而,其最优性主要在轻尾或属于指数族的单参数模型下被讨论。本文考虑 TS 在具有重尾且由两未知参数参数化的 Pareto 模型中的最优性。具体而言,我们讨论使用包含 Jeffreys 先验与参考先验的概率匹配先验的 TS 的最优性。我们首先证明使用特定概率匹配先验的 TS 可达到最优后悔界。随后,我们展示使用其他先验(包括 Jeffreys 与参考先验)的 TS 的次优性。尽管如此,我们发现若采用截断过程,使用 Jeffreys 与参考先验的 TS 可达到渐近下界。这些结果表明应谨慎选择无信息先验以避免次优性,并显示了截断过程在基于 TS 的策略中的有效性。
引用
@article{arxiv.2302.01544,
title = {Optimality of Thompson Sampling with Noninformative Priors for Pareto Bandits},
author = {Jongyeong Lee and Junya Honda and Chao-Kai Chiang and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2302.01544},
year = {2023}
}
备注
49 pages, a preprint