InferSpark:大规模统计推断
数据库
2017-10-10 v2
摘要
Apache Spark 栈已实现快速的大规模数据处理。尽管拥有丰富的统计模型与推断算法库,它并未赋予领域用户开发自身模型的能力。概率编程语言的涌现展示了以简洁且程序化的方式开发复杂概率模型的前景。这些框架有潜力自动为用户定义的模型生成推断算法,并回答关于模型的各种统计查询。将这两个伟大方向结合起来以产生可编程的大数据分析框架正是时机。因此我们提出 InferSpark,一个构建于 Apache Spark 之上的概率编程框架。高效的统计推断可在此框架上轻松实现,且推断过程能利用 Spark 的分布式主内存处理能力。该框架使大数据上的统计推断成为可能,并加速概率编程向数据工程领域的渗透。
引用
@article{arxiv.1707.02047,
title = {InferSpark: Statistical Inference at Scale},
author = {Zhuoyue Zhao and Jialing Pei and Eric Lo and Kenny Q. Zhu and Chris Liu},
journal= {arXiv preprint arXiv:1707.02047},
year = {2017}
}
备注
13 pages, 22 figures