中文

通过凝聚子图计算驯服犯罪分析中的近重复计算

数据结构与算法 2020-03-27 v2 计算几何

摘要

近重复(NR)是犯罪分析中一个众所周知的现象,它假定犯罪事件在给定的时间和空间范围内表现出相关性。传统的 NR 计算会在给定时空限制内发生 2 个事件时生成 2 个事件对。然而,当事件数量很大时,NR 计算非常耗时,且这些事件对的组织方式尚未被探索。在本文中,我们设计了一种新方法来高效计算 NR 事件簇。首先,利用 R 树索引犯罪事件,单个事件由一个顶点表示,而边则通过在 R 树中对顶点进行范围查询来构建,从而形成一个图。应用凝聚子图方法来识别事件链。根据它们发现凝聚子图能力的不同范围,依次实现了 k-clique、k-truss、k-core 以及 DBSCAN 算法。利用芝加哥、纽约和华盛顿特区的真实犯罪数据进行了实验。通过执行 Mapreduce 赋能的 knox 检验,实验证实了近重复在真实大规模犯罪数据中是一种稳健的效应。验证了 4 种不同算法的性能,同时通过凝聚子图数量的分布及其聚类系数来衡量算法的质量。所提出的框架是首个处理百万记录规模真实犯罪数据的框架,也是首个检测规模大于 2 的 NR 事件的框架。

关键词

引用

@article{arxiv.1705.07746,
  title  = {Taming Near Repeat Calculation for Crime Analysis via Cohesive Subgraph Computing},
  author = {Zhaoming Yin and Xuan Shi},
  journal= {arXiv preprint arXiv:1705.07746},
  year   = {2020}
}

备注

The Twelfth International Conference on Advanced Geographic Information Systems, Applications, and Services GEOProcessing 2020, ISBN 978-1-61208-762-7