中文

评估时间序列间有向与多变量线性依赖度量的显著性

统计方法学 2021-02-24 v3 信息论 math.IT 统计理论 数据分析、统计与概率 神经元与认知 应用统计 统计理论

摘要

推断时间序列之间的线性依赖关系是我们理解自然与人工系统的核心。遗憾的是,用于从时间序列数据中确定统计显著的有向或多变量关系的假设检验常常产生虚假关联(I类错误)或遗漏因果关系(II类错误)。这是由于所分析时间序列中存在的自相关——一种在从大脑动力学到气候变化的众多应用中普遍存在的特性。本文表明,对于有限数据,该问题不能仅靠拟合时间序列模型(例如Granger因果或预白化方法)来解决,而应当改变假设检验中的自由度,以考虑观测值中互相关所引起的有效样本量。这一见解使我们能够推导出针对协方差平稳时间序列之间任意基于多变量相关的线性依赖度量的修正假设检验,包括具有高斯边缘分布的Granger因果与互信息。我们使用数值模拟(由自回归模型与数字滤波生成)以及记录的fMRI神经影像数据表明,我们的检验对于各类平稳时间序列是无偏的。我们的实验证明,常用的FF-与χ2\chi^2-检验对于两种度量(无论信号是否预白化)均可导致高达100%100\%的显著假阳性率。这些发现表明,如果不对修正假设检验加以使用,科学文献中报告的许多依赖关系可能已被且将继续被虚假报告或遗漏。

关键词

引用

@article{arxiv.2003.03887,
  title  = {Assessing the Significance of Directed and Multivariate Measures of Linear Dependence Between Time Series},
  author = {Oliver M. Cliff and Leonardo Novelli and Ben D. Fulcher and James M. Shine and Joseph T. Lizier},
  journal= {arXiv preprint arXiv:2003.03887},
  year   = {2021}
}

备注

27 pages, 14 figures, final submission to Phys Rev. Research editors (before copyediting)