FlashP:面向时序关系数据实时预测的分析流水线
数据库
2021-01-19 v2 机器学习
摘要
交互响应时间对于分析流水线十分重要,用户借此可探索足够多的可能性并做出明智的业务决策。我们考虑一个具有大批量高维时间序列数据的预测流水线。实时预测可分两步进行。首先,通过对数据进行切片、切块与聚合,指定需关注的数据部分及待预测的度量。其次,在聚合结果上训练预测模型以预测指定度量的趋势。尽管已有众多预测模型,第一步却是性能瓶颈。一个自然的想法是利用采样实时获得近似聚合作为训练预测模型的输入。我们可扩展的实时预测系统 FlashP(Flash Prediction)基于该想法构建,本文需解决两个主要挑战:第一,我们需要明确近似聚合如何影响预测模型的拟合及预测结果;第二,相应地,我们应使用何种采样算法获得这些近似聚合以及样本量多大。我们提出一种称为 GSW 采样的新采样方案,并分析了使用 GSW 样本估计聚合的误差界。我们介绍了在存在多个待分析度量时如何构建紧凑的 GSW 样本。我们通过实验评估我们的方案,并在真实数据上与替代方法进行比较。
引用
@article{arxiv.2101.03298,
title = {FlashP: An Analytical Pipeline for Real-time Forecasting of Time-Series Relational Data},
author = {Shuyuan Yan and Bolin Ding and Wei Guo and Jingren Zhou and Zhewei Wei and Xiaowei Jiang and Sheng Xu},
journal= {arXiv preprint arXiv:2101.03298},
year = {2021}
}