中文

在离散化中为所有符号创造公平的竞争环境

数据结构与算法 2012-10-19 v1 人工智能

摘要

在时间序列分析研究中,人们对实数值数据流的离散表示有着浓厚的兴趣。十多年前出现的一种方法至今仍被认为是最先进的,即符号聚合近似 (Symbolic Aggregate Approximation, SAX) 算法。该离散化算法是第一个将实值时间序列映射到符号表示的符号方法,并保证该表示是欧几里得距离的下界。本文关注的是 SAX 关于数据高度服从高斯分布的假设,以及使用标准正态曲线来选择分区以离散化数据。虽然不一定,但通常在其规范形式中,SAX 方法在标准正态曲线上选择分区,以使有限字母表中的每个符号出现的概率相等。由于在应用 SAX 算法的其余部分之前会对时间序列进行归一化处理,此过程通常是有效的。然而,由于分段聚合近似 (Piecewise Aggregate Approximation, PAA) 的中间步骤,这种等概率假设存在一个缺陷。本文将在研究中表明,当应用 PAA 时,数据的分布确实发生了改变,导致标准差缩小,其缩小程度与用于创建 PAA 表示段的点数以及序列内的自相关程度成正比。表现出统计显著自相关的数据受这种分布缩小的影响较小。随着数据标准差的收缩,均值保持不变,但分布不再服从标准正态分布,因此基于标准正态曲线的分区不再适用于等概率假设。

关键词

引用

@article{arxiv.1210.5118,
  title  = {Creating a level playing field for all symbols in a discretization},
  author = {Matthew Butler and Dimitar Kazakov},
  journal= {arXiv preprint arXiv:1210.5118},
  year   = {2012}
}