中文

面向时间序列降维与在线异常检测的分布无关符号表示

信息检索 2024-04-24 v2 机器学习

摘要

由于下界距离的重要性以及符号表示的吸引力,符号聚合近似(SAX)系列方法已被广泛用于时间序列数据编码。然而,典型的基于SAX的方法依赖于两个限制性假设:高斯分布与等概率符号。本文提出两种新颖的数据驱动的基于SAX的符号表示,以离散化步骤相区分。第一种表示面向一般数据压缩与索引场景,基于核密度估计与Lloyd-Max量化的结合,以最小化离散化步骤中的信息损失与均方误差。第二种方法面向高层挖掘任务,采用均值漂移(Mean-Shift)聚类方法,并证明可增强低维空间中的异常检测。此外,我们在理论基础上验证了先前观察到的一种内在过程现象,该过程导致中间分段聚合近似的方差低于预期。此现象造成额外的信息损失,但可通过简单修正加以避免。所提出的表示具备传统SAX方法的所有吸引人特性。进一步地,在真实数据集上的实验评估表明了它们相对于传统SAX及一种替代的数据驱动SAX变体的优越性。

关键词

引用

@article{arxiv.2105.09592,
  title  = {Distribution Agnostic Symbolic Representations for Time Series Dimensionality Reduction and Online Anomaly Detection},
  author = {Konstantinos Bountrogiannis and George Tzagkarakis and Panagiotis Tsakalides},
  journal= {arXiv preprint arXiv:2105.09592},
  year   = {2024}
}

备注

Accepted for publication in IEEE Transactions on Knowledge and Data Engineering. Compared to the previous version, now the cSAX symbolic representation is also used for discord discovery