中文

集成时间序列摘要与预测算法及其在 COVID-19 数据挖掘中的应用

应用统计 2020-05-05 v1 机器学习 机器学习

摘要

本文提出一种简单方法,从一组多个相关时间序列中,基于全体时间序列集合的统计量提取每个时间序列的压缩表示。这通过一个分层算法实现:首先基于聚类数据质心的分段生成形状词字母表,随后通过使用无约束动态时间规整作为距离度量(以处理非均匀时间序列长度)的最近邻搜索,将这些形状词的标签分配给每个单独时间序列的分段。由此,为每个时间序列分配一个标签序列。最后一个标签序列的完成为个体时间序列的预测提供了条件。所提方法在两个全球 COVID-19 数据集上进行了评估:第一,每日净病例数(每日新感染数减去每日康复数);第二,截至 2020 年 4 月 27 日归因于 COVID-19 的每日死亡数。第一个数据集涉及不同国家的 249 个时间序列,每个长度为 96。第二个数据集涉及 264 个时间序列,每个长度为 96。基于可用数据中检测到的异常,本文主张一种去中心化的解除封锁策略。

关键词

引用

@article{arxiv.2005.00592,
  title  = {Integrated Time Series Summarization and Prediction Algorithm and its Application to COVID-19 Data Mining},
  author = {Mogens Graf Plessen},
  journal= {arXiv preprint arXiv:2005.00592},
  year   = {2020}
}

备注

10 pages double column, 8 figures, 1 table