关于大规模决策问题中 Thompson 采样的一点注记
统计方法学
2019-05-14 v1
摘要
在包括移动健康、食品安全、安全和资源管理等广泛应用领域,利用流数据辅助决策的兴趣日益增长。决策支持系统将在线决策形式化为从最新信息到推荐决策的映射。从流数据在线估计最优决策策略需要同时估计底层系统动态的组成部分以及给定这些动态的最优决策策略;因此,在选择可改进估计的决策与选择基于当前估计看似最优的决策之间存在固有的权衡。Thompson(1933)最早在为患者流选择两种治疗的背景下形式化了这一权衡;他提出了一种简单启发式,即在每个时间点以正比于其为最优的后验概率的选取概率随机选取一种治疗。我们考虑一种易于实现且可应用于大规模复杂决策问题的 Thompson 采样变体。我们证明了所提出的 Thompson 采样估计量对最优决策支持系统是一致的,并给出了收敛速率与有限样本误差界。所提算法通过使用流感在网络上传播的基于主体模型以及美国绿头鸭种群管理进行了说明。
引用
@article{arxiv.1905.04735,
title = {Note on Thompson sampling for large decision problems},
author = {Tao Hu and Eric B. Laber and Zhen Li and Nick J. Meyer and Krishna Pacifici},
journal= {arXiv preprint arXiv:1905.04735},
year = {2019}
}