中文

catch22:典型时间序列特征

信息检索 2019-02-05 v2 机器学习 机器学习

摘要

将时间序列的动态特性简洁地捕获为可解释的特征向量,能够实现对科学与工业中时间序列应用的高效聚类和分类。通过对全面的时间序列特征库(如 hctsa 工具箱中的特征库)进行系统比较,可以为给定应用选择适当的时间序列基于特征的表示。然而,这种方法计算代价高昂,并且涉及评估许多相似特征,限制了基于特征的时间序列表示在现实应用中的广泛采用。在这项工作中,我们引入一种方法来推断小的时间序列特征集,其(i)在给定时间序列问题集合上展现出强劲的分类性能,且(ii)冗余最小。将我们的方法应用于一组 93 个时间序列分类数据集(包含超过 147000 个时间序列),并使用 hctsa 特征库的过滤版本(4791 个特征),我们引入了 22 个通用有用的典型时间序列特征,catch22。这种从 4791 到 22 的维度缩减,伴随着约 1000 倍的计算时间减少和随序列长度的近线性缩放,尽管平均分类精度仅降低 7%。catch22 从线性与非线性自相关、连续差分、值分布与离群值以及涨落标度特性等方面捕获了时间序列的多样且可解释的签名。我们提供了 catch22 的高效实现,可从许多编程环境访问,使用可解释时间序列特性的通用语言,促进科学、工业、金融和医学应用中的基于特征的时间序列分析。

关键词

引用

@article{arxiv.1901.10200,
  title  = {catch22: CAnonical Time-series CHaracteristics},
  author = {Carl H Lubba and Sarab S Sethi and Philip Knaute and Simon R Schultz and Ben D Fulcher and Nick S Jones},
  journal= {arXiv preprint arXiv:1901.10200},
  year   = {2019}
}