中文

统计判别性子轨迹挖掘

机器学习 2019-05-07 v1 机器学习

摘要

我们研究判别性子轨迹挖掘问题。给定两组轨迹,该问题的目标是以子轨迹形式提取移动模式,这些子轨迹与一组的子轨迹更相似,而与另一组的子轨迹较不相似。我们针对此问题提出一种称为统计判别性子轨迹挖掘 (SDSM) 的新方法。SDSM 方法的一个优势在于,所提取子轨迹的统计显著性得到恰当控制,即发现假阳性子轨迹的概率小于指定的显著性阈值 alpha (例如 0.05),这在噪声环境下的科学或社会研究中不可或缺。从海量轨迹数据集中寻找此类统计判别性子轨迹在计算与统计上均具挑战性。在 SDSM 方法中,我们通过引入子轨迹间的树表示并在该树上运行高效的基于置换的统计推断方法来化解这些困难。据我们所知,SDSM 是首个能够从含 1,000,000 条轨迹(包含 16,723,602,505 条子轨迹)的海量轨迹数据集中高效提取统计判别性子轨迹的方法。我们通过将 SDSM 应用于该真实数据集,展示了其有效性与可扩展性。

关键词

引用

@article{arxiv.1905.01788,
  title  = {Statistically Discriminative Sub-trajectory Mining},
  author = {Vo Nguyen Le Duy and Takuto Sakuma and Taiju Ishiyama and Hiroki Toda and Kazuya Nishi and Masayuki Karasuyama and Yuta Okubo and Masayuki Sunaga and Yasuo Tabei and Ichiro Takeuchi},
  journal= {arXiv preprint arXiv:1905.01788},
  year   = {2019}
}