重用、回收、重加权:通过针对海量数据的高效序贯贝叶斯计算对抗流感
应用统计
2011-01-06 v1
摘要
千兆字节和太字节范围内的海量数据集,结合日益复杂的统计工具的可用性,使得分析处于计算可行性的边界。面对这种计算负担,通过将数据集划分为更易处理的规模而做出的妥协,导致了分层分析,这脱离了证明最初数据收集合理的背景。在贝叶斯框架中,这些分层分析生成了中间实现,通常使用点估计进行比较,而这些点估计未能考虑这些实现所近似的分布内部的变异性和分布之间的相关性。然而,尽管最初对分层的让步通常排除了使用单一联合层次模型进行更合理分析的可能性,我们可以通过扩展动态迭代重加权MCMC算法来规避这一结果并利用这些中间实现。在此过程中,我们通过用重要性权重对可用的实现进行重加权来重用它们,将其回收到一个现在易于处理的联合层次模型中。我们将此技术应用于对跨越13年的687个甲型流感基因组的分层分析所生成的中间实现,使我们能够在层次统计框架内重新审视有关流感进化史的假设。
引用
@article{arxiv.1101.0959,
title = {Reuse, recycle, reweigh: Combating influenza through efficient sequential Bayesian computation for massive data},
author = {Jennifer A. Tom and Janet S. Sinsheimer and Marc A. Suchard},
journal= {arXiv preprint arXiv:1101.0959},
year = {2011}
}
备注
Published in at http://dx.doi.org/10.1214/10-AOAS349 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)