增量式处理分析型工作负载
数据库
2015-09-18 v1
摘要
使用流行的机器学习和统计算法分析大型数据集一直是一个日益受到关注的研究课题。典型的分析工作负载包括应用算法在数据集上构建模型,随后根据结果对其进行细化。在本文中,我们将模型物化和增量模型重用作为分析工作负载执行中的一等公民引入。我们将构建的模型物化而非丢弃,以便在后续计算中重用。同时,我们考虑通过操作现有模型(向其添加或删除数据)来构建新模型。我们在流行的机器学习模型背景下讨论了我们的方法。我们详细说明了如何增量维护模型,并概述了为最优地利用模型及其增量调整来构建新模型所需的适当优化。我们详述了针对线性回归、朴素贝叶斯和逻辑回归的技术,并提出了在我们的框架中处理这些模型的合适算法与优化。我们使用真实和合成数据集展示了详细的性能评估结果。我们的实验分析了该方法固有的各种权衡,并展示了巨大的性能优势。
引用
@article{arxiv.1509.05066,
title = {Processing Analytical Workloads Incrementally},
author = {Priyank Gupta and Nick Koudas and Europa Shang and Ryan Johnson and Calisto Zuzarte},
journal= {arXiv preprint arXiv:1509.05066},
year = {2015}
}