海量数据集上的分布式子轨迹连接
数据库
2020-02-07 v1 分布式、并行与集群计算
摘要
轨迹数据集的连接是移动数据分析中的一项重要操作,也是旨在从中提取知识的各类方法的基石。在大数据时代,移动数据的产生已变得海量,因此以集中式方式执行此类操作不可行。本文利用 MapReduce 编程模型解决分布式子轨迹连接(Distributed Subtrajectory Join)处理问题。与传统轨迹连接查询相比,该问题更具挑战性,因为其目标是检索所有“相似”的轨迹“极大”片段。我们提出三种方案:(i)精心设计的基方案 DTJb,(ii)使用重分区数据预处理步骤的方案 DTJr,以及(iii)额外采用索引机制的方案 DTJi。在实验研究中,我们使用了来自海事领域的 56GB 真实轨迹数据集,据我们所知,这是轨迹数据管理文献中用于实验的最大真实数据集。结果表明,DTJi 比 DTJb 快至多 16 倍,比 DTJr 快 10 倍,比最接近的同类 state of the art 算法快 3 倍。
引用
@article{arxiv.1903.07748,
title = {Distributed Subtrajectory Join on Massive Datasets},
author = {Panagiotis Tampakis and Christos Doulkeridis and Nikos Pelekis and Yannis Theodoridis},
journal= {arXiv preprint arXiv:1903.07748},
year = {2020}
}