中文

从新闻中提取实体与主题并关联犯罪记录

信息检索 2020-05-05 v1 计算与语言

摘要

本文旨在总结用于从犯罪记录数据库和报纸数据库中提取实体与主题的方法论。统计模型已成功用于研究约300,000篇《纽约时报》文章的主题。此外,这些模型也已成功用于分析与人、组织和地点相关的实体(D Newman, 2006)。另外,一些研究中使用分析方法(尤其是热点制图)以预测未来的犯罪地点与情境,且这些方法已得到相当成功的检验(S Chainey, 2008)。基于上述两种理念,本研究旨在应用数据科学技术分析大量数据、筛选有价值的情报、依据犯罪类型对违法行为进行聚类,并构建随时间演变的犯罪图。在本研究中,任务是从Kaggle及EAGER项目数据库下载犯罪数据集与新闻文章集合,随后将这些数据集合并为一个通用数据集。该项目最重要的目标是通过统计与自然语言处理方法提取实体与主题,并将相似数据点分组至正确簇中,以更好地理解关于美国相关犯罪的公开数据。

关键词

引用

@article{arxiv.2005.00950,
  title  = {Extracting Entities and Topics from News and Connecting Criminal Records},
  author = {Quang Pham and Marija Stanojevic and Zoran Obradovic},
  journal= {arXiv preprint arXiv:2005.00950},
  year   = {2020}
}

备注

This is a report submitted by an undergraduate student as preliminary work on this problem