高斯 bandit 问题中 Thompson 采样的最优性依赖于先验分布
统计理论
2013-11-11 v1 概率论
统计理论
摘要
在随机 bandit 问题中,一种称为 Thompson 采样 (TS) 的贝叶斯策略因其卓越的实证表现而备受关注。然而,该策略的理论分析十分困难,其渐近最优性仅在单参数模型中得到证明。本文讨论了 TS 在均值和方差均未知的正态分布模型中的最优性,这是多参数模型中最基本的例子之一。首先,我们证明了采用均匀先验的 TS 的期望遗憾达到了理论界,这是首个表明正态分布模型可实现渐近界的结果。其次,我们证明了采用 Jeffreys 先验和参考先验的 TS 无法达到该理论界。因此,先验的选择对 TS 至关重要,且在多参数模型情形下,无信息先验有时具有风险。
引用
@article{arxiv.1311.1894,
title = {Optimality of Thompson Sampling for Gaussian Bandits Depends on Priors},
author = {Junya Honda and Akimichi Takemura},
journal= {arXiv preprint arXiv:1311.1894},
year = {2013}
}