全局约束对时间序列数据库相似性度量的影响
人工智能
2013-12-30 v2
摘要
时间序列由随时间重复测量获得的一系列数值或事件组成。时间序列分析在股票市场分析、过程与质量控制、自然现象观测、医疗处理等许多应用领域中都是重要工具。许多类型的时间序列分析中,一个关键组成部分是选择合适的距离/相似性度量。迄今为止已提出了大量度量方法,其中最成功的基于动态规划。然而,由于具有平方时间复杂度,通常采用全局约束来限制动态规划过程中矩阵的搜索空间,以加速计算。此外,已有报道称这种受约束的度量也能获得更好的精度。本文研究了两种具有代表性的基于动态规划的时间序列距离/相似性度量——动态时间规整(Dynamic Time Warping, DTW)和最长公共子序列(Longest Common Subsequence, LCS),以及全局约束对它们的影响。通过在大量时间序列数据集上的广泛实验,我们展示了全局约束如何显著减少 DTW 和 LCS 的计算时间。我们还表明,如果约束参数足够紧(小于时间序列长度的 10-15%),受约束的度量与其无约束的对应度量在产生定性不同的 1-最近邻图的意义上变得显著不同。这一观察解释了使用受约束度量时精度提升的潜力,并强调了为实现速度与精度之间的良好权衡,需要仔细调整约束参数。
引用
@article{arxiv.1107.0134,
title = {The Influence of Global Constraints on Similarity Measures for Time-Series Databases},
author = {Vladimir Kurbalija and Miloš Radovanović and Zoltan Geler and Mirjana Ivanović},
journal= {arXiv preprint arXiv:1107.0134},
year = {2013}
}