中文

面向可扩展轨迹相似搜索的紧凑三进制数组字典树

数据结构与算法 2020-09-23 v2 数据库 机器学习

摘要

代表多种运动物体移动性的空间轨迹海量数据集在研究与工业界中无处不在。对大规模轨迹集合进行相似度搜索是将这些数据集转化为知识所不可或缺的。局部敏感哈希(LSH)是一种用于快速相似搜索的强大技术。近期方法采用LSH并尝试实现高效的轨迹相似搜索;然而,当应用于海量数据集时,这些方法在搜索时间与内存方面效率低下。为解决该问题,我们提出轨迹索引紧凑三进制数组字典树(tSTAT),这是一种利用LSH进行轨迹相似搜索的可扩展方法。tSTAT在称为字典树(trie)的树形数据结构上快速执行搜索。我们还提出两种新技术,可显著提升tSTAT的内存效率。其一为节点约简技术,在保持时间性能的同时大幅省略冗余字典树节点。其二是空间高效表示,利用了紧凑数据结构(即支持快速数据操作的压缩数据结构)背后的思想。我们在从大型轨迹集合中为查询检索相似轨迹的能力上对tSTAT进行了实验测试,结果表明tSTAT相较于最先进的相似搜索方法表现更优。

关键词

引用

@article{arxiv.2005.10917,
  title  = {Succinct Trit-array Trie for Scalable Trajectory Similarity Search},
  author = {Shunsuke Kanda and Koh Takeuchi and Keisuke Fujii and Yasuo Tabei},
  journal= {arXiv preprint arXiv:2005.10917},
  year   = {2020}
}

备注

Accepted by ACM SIGSPATIAL 2020 as a full paper