中文

云计算环境下基于周期性的并行时间序列预测算法

机器学习 2018-10-19 v1 机器学习

摘要

在大数据时代,各领域实际应用不断产生大规模时间序列数据。其中部分数据呈现出显著或潜在的周期性特征,如气象与金融数据。从海量时间序列数据中高效识别潜在周期模式并提供准确预测至关重要。本文提出并在 Apache Spark 云计算环境下实现了一种面向大规模时间序列数据的基于周期性的并行时间序列预测(PPTSP)算法。为有效处理海量历史数据集,提出时间序列数据压缩与抽象(TSDCA)算法,该算法可在缩减数据规模的同时准确提取特征。在此基础上,利用傅里叶谱分析(FSA)方法提出多层时间序列周期模式识别(MTSPPR)算法。此外,提出基于周期性的时间序列预测(PTSP)算法,基于所有先前周期模型预测后续周期数据,并引入时间衰减因子以控制不同周期对预测结果的影响。进而,为提升所提算法性能,基于 Apache Spark 平台的 Streaming 实时计算模块给出并行方案,使用分布式流(DStreams)与弹性分布式数据集(RDDs)在分布式计算环境中存储与计算这些数据集。大量实验结果表明,我们的 PPTSP 算法在预测精度与性能上相较其他算法具有显著优势。

关键词

引用

@article{arxiv.1810.07776,
  title  = {A Periodicity-based Parallel Time Series Prediction Algorithm in Cloud Computing Environments},
  author = {Jianguo Chen and Kenli Li and Huigui Rong and Kashif Bilal and Keqin Li and Philip S. Yu},
  journal= {arXiv preprint arXiv:1810.07776},
  year   = {2018}
}