中文

使用无信息先验的 Thompson 采样在 Pareto 赌博机中的最优性

机器学习 2023-02-06 v1 统计理论 机器学习 统计理论

摘要

在随机多臂赌博机问题中,一种称为 Thompson 采样(TS)的随机化概率匹配策略已在多种奖励模型中展现出优异性能。除经验性能外,TS 已被证明在若干模型中达到渐近问题依赖下界。然而,其最优性主要在轻尾或属于指数族的单参数模型下被讨论。本文考虑 TS 在具有重尾且由两未知参数参数化的 Pareto 模型中的最优性。具体而言,我们讨论使用包含 Jeffreys 先验与参考先验的概率匹配先验的 TS 的最优性。我们首先证明使用特定概率匹配先验的 TS 可达到最优后悔界。随后,我们展示使用其他先验(包括 Jeffreys 与参考先验)的 TS 的次优性。尽管如此,我们发现若采用截断过程,使用 Jeffreys 与参考先验的 TS 可达到渐近下界。这些结果表明应谨慎选择无信息先验以避免次优性,并显示了截断过程在基于 TS 的策略中的有效性。

关键词

引用

@article{arxiv.2302.01544,
  title  = {Optimality of Thompson Sampling with Noninformative Priors for Pareto Bandits},
  author = {Jongyeong Lee and Junya Honda and Chao-Kai Chiang and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2302.01544},
  year   = {2023}
}

备注

49 pages, a preprint