中文

基于特征的时间序列分析:R 语言中 theft 包的使用

机器学习 2023-07-04 v4 机器学习 数学软件 定量方法 应用统计 统计方法学

摘要

时间序列在科学各领域被测量与分析。量化时间序列结构的一种方法是计算一组汇总统计量或“特征”,然后将时间序列以其性质表示为特征向量。所得特征空间可解释且信息丰富,并使聚类、回归和分类等传统统计学习方法能够应用于时间序列数据集。多种编程语言中已存在许多用于计算时间序列特征集的开源软件包,包括 catch22(22 个特征:Matlab、R、Python、Julia)、feasts(42 个特征:R)、tsfeatures(63 个特征:R)、Kats(40 个特征:Python)、tsfresh(779 个特征:Python)和 TSFEL(390 个特征:Python)。然而,存在若干问题:(i)目前尚无访问这些包的统一入口;(ii)要使用所有特征集,用户必须精通多种语言;(iii)这些特征提取包缺乏用于执行基于特征的时间序列分析(如时间序列分类应用)的广泛配套方法流程。在此我们介绍一个 R 软件包 theft(Tools for Handling Extraction of Features from Time series,时间序列特征提取处理工具)以解决上述问题。theft 是一个统一且可扩展的框架,用于计算上述六个开源时间序列特征集的特征。它还包括一套用于处理与解释所提取特征表现的函数,涵盖广泛的数据可视化模板、低维投影和时间序列分类操作。随着科学与工业中时间序列数据集体量与复杂度的增长,theft 为全面量化与解释时间序列中的信息结构提供了标准化框架。

关键词

引用

@article{arxiv.2208.06146,
  title  = {Feature-Based Time-Series Analysis in R using the theft Package},
  author = {Trent Henderson and Ben D. Fulcher},
  journal= {arXiv preprint arXiv:2208.06146},
  year   = {2023}
}