大数据流上的增量查询处理
数据库
2016-08-23 v3 分布式、并行与集群计算
摘要
本文探讨在分布式流处理引擎(DSPE)上进行大规模增量数据分析的在线查询处理。我们的目标是将任何类SQL查询自动转换为增量DSPE程序。与其他方法不同,我们推导出的增量程序返回精确结果,而非近似答案。这是通过在查询评估生命周期内保留最小状态,并使用增量评估技术,在每个时间间隔返回一个依赖于当前状态和最新数据批次的精确快照答案来实现的。我们的方法能够处理嵌套数据集合上的多种查询形式,包括迭代与嵌套查询、带聚合的分组以及等值连接。最后,我们报告了我们的框架的原型实现,称为MRQL Streaming,运行于Spark之上,并通过实验验证了方法的有效性。
引用
@article{arxiv.1511.07846,
title = {Incremental Query Processing on Big Data Streams},
author = {Leonidas Fegaras},
journal= {arXiv preprint arXiv:1511.07846},
year = {2016}
}
备注
Extended version of a paper submitted to a journal