中文

时间序列中尖峰的识别

应用统计 2018-01-25 v1

摘要

识别时间序列中意外的高值对流行病学家、经济学家及其他关注暴露尖峰对结果变量影响的社会科学家而言是有用的。然而,识别时间序列中尖峰的最佳方法尚属未知。本文旨在通过在一个模拟设定中测试若干尖峰检测方法的表现来填补这一空白。我们创建了以九座加利福尼亚城市月度暴力事件率为参数、代表不同序列特征的模拟数据,并随机向序列中插入尖峰。随后我们比较了以下方法的尖峰检测能力:ARIMA 建模、Kalman 滤波与平滑、带软阈值的 wavelet 建模,以及一种迭代离群点检测方法。我们将尖峰幅度从研究期内平均率的 10% 变化至 50%,并将插入尖峰数量从 1 变化至 10。我们使用灵敏度与特异度评估各方法的性能。Kalman 滤波与平滑过程具有最佳的整体表现。我们将 Kalman 滤波与平滑应用于九座加利福尼亚城市的月度暴力事件率,并识别了 2005–2012 年间的率中尖峰。

关键词

引用

@article{arxiv.1801.08061,
  title  = {Identification of Spikes in Time Series},
  author = {Dana E. Goin and Jennifer Ahern},
  journal= {arXiv preprint arXiv:1801.08061},
  year   = {2018}
}