SSH (Sketch, Shingle, & Hash):用于大规模时间序列索引
信息检索
2016-10-25 v1
摘要
时间序列相似性搜索是大规模数据驱动应用中的常见操作。由于时间序列通常未对齐,复杂的相似性度量已成为时间序列匹配的标准。动态时间规整 (DTW) 是最广泛使用的时间序列相似性度量,因为它同时结合了对齐与匹配。然而,对齐过程使得 DTW 速度缓慢。为了加速基于 DTW 的昂贵相似性搜索,人们采用了基于分支定界的剪枝策略。然而,基于分支定界的剪枝仅适用于非常短的查询(低维时间序列),且对于较长查询其界限相当弱。由于界限宽松,分支定界剪枝策略退化为暴力搜索。为解决此问题,我们设计了 SSH (Sketch, Shingle, & Hashing),这是一种高效且近似的哈希方案,其速度远优于最先进的分支定界搜索技术(UCR suite)。SSH 采用素描 (sketching)、分片 (shingling) 和哈希技术的 novel 组合,生成与 DTW 相似性度量(近乎完美)对齐的(概率)索引。生成的索引随后用于创建哈希桶以实现次线性搜索。结果表明,SSH 对于较长时间序列非常有效,可剪枝约 95% 的候选项,从而大幅加速 DTW 搜索。在两个大规模基准时间序列数据上的实证结果显示,我们提出的方法比最先进的软件包(UCR suite)快约 20 倍,且精度无显著损失。
引用
@article{arxiv.1610.07328,
title = {SSH (Sketch, Shingle, & Hash) for Indexing Massive-Scale Time Series},
author = {Chen Luo and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:1610.07328},
year = {2016}
}