中文

高斯 bandit 问题中 Thompson 采样的最优性依赖于先验分布

统计理论 2013-11-11 v1 概率论 统计理论

摘要

在随机 bandit 问题中,一种称为 Thompson 采样 (TS) 的贝叶斯策略因其卓越的实证表现而备受关注。然而,该策略的理论分析十分困难,其渐近最优性仅在单参数模型中得到证明。本文讨论了 TS 在均值和方差均未知的正态分布模型中的最优性,这是多参数模型中最基本的例子之一。首先,我们证明了采用均匀先验的 TS 的期望遗憾达到了理论界,这是首个表明正态分布模型可实现渐近界的结果。其次,我们证明了采用 Jeffreys 先验和参考先验的 TS 无法达到该理论界。因此,先验的选择对 TS 至关重要,且在多参数模型情形下,无信息先验有时具有风险。

关键词

引用

@article{arxiv.1311.1894,
  title  = {Optimality of Thompson Sampling for Gaussian Bandits Depends on Priors},
  author = {Junya Honda and Akimichi Takemura},
  journal= {arXiv preprint arXiv:1311.1894},
  year   = {2013}
}