中文

犯罪主题建模

计算与语言 2018-08-08 v2

摘要

将犯罪分类为离散类别会导致大量信息丢失。犯罪源于行为与情境的复杂混合,然而这些细节大多无法被单一的犯罪类型标签所捕捉。这种信息丢失不仅影响我们理解犯罪成因的能力,也影响我们如何制定最优的犯罪预防策略。我们应用机器学习方法于伴随犯罪记录的简短叙述性文本描述,旨在发现生态上更有意义的潜在犯罪类别。我们称这些潜在类别为“犯罪主题”,以指代生成它们的基于文本的主题建模方法。我们使用主题分布来度量正式认可的犯罪类型之间的聚类。犯罪主题复制了暴力犯罪与财产犯罪之间的宽泛区分,但也揭示了与目标特征、情境条件以及攻击工具和方法相关的细微差别。正式的犯罪类型在主题空间中并非离散的。相反,犯罪类型分布于一系列犯罪主题之上。类似地,单个犯罪主题也分布于一系列正式犯罪类型之中。关键的生态群组包括身份盗窃、商店盗窃、入室盗窃与盗窃、汽车犯罪与故意破坏、犯罪威胁与诈骗犯罪,以及暴力犯罪。尽管犯罪主题不能替代正式的法律犯罪分类,但它们为理解犯罪背后异质性的因果过程提供了独特的窗口。

关键词

引用

@article{arxiv.1701.01505,
  title  = {Crime Topic Modeling},
  author = {Da Kuang and P. Jeffrey Brantingham and Andrea L. Bertozzi},
  journal= {arXiv preprint arXiv:1701.01505},
  year   = {2018}
}

备注

47 pages, 4 tables, 7 figures