应用于白领犯罪调查的自然语言处理方法的性能评估
信息检索
2016-09-06 v1 计算机与社会
摘要
在当今世界,我们每天都要面对来自各种来源且日益增加的海量信息。个人和企业正在大规模产生数据,而自互联网、电子邮件和社交媒体兴起以来,产生的数据量呈指数级增长。从执法的角度来看,当对个人或公司发起刑事调查时,我们必须处理这些海量数据。需要回答相关问题,例如谁实施了犯罪、谁参与了、发生了什么以及在什么时间、谁进行了通信以及内容是什么?不仅可供调查的数据量急剧增加,数据的复杂性也有所增加。当需要将这些通信模式与例如被扣押的财务管理系统或企业文档共享相结合时,就出现了一个复杂的调查问题。最近,当需要在必须处理大型复杂数据集的大数据环境中寻找犯罪证据时,尤其是在财务和欺诈调查中,刑事调查人员面临着巨大挑战。为了解决这个问题,某欧洲国家的财务与欺诈调查部门开发了一款名为 LES 的新工具,该工具使用自然语言处理(NLP)技术帮助刑事调查人员以更高效、更快捷的方式处理大量文本信息。在本文中,我们简要介绍了该工具,并重点从取证调查的要求角度评估其性能:速度、对调查人员而言更智能且更易用。为了评估这款 LES 工具,我们使用了不同的性能指标。我们还展示了在来自实际应用的大型复杂数据集上进行评估的实验结果。
引用
@article{arxiv.1609.00992,
title = {Performance Evaluation of a Natural Language Processing approach applied in White Collar crime investigation},
author = {Maarten Banerveld and Nhien-An Le-Khac and Tahar Kechadi},
journal= {arXiv preprint arXiv:1609.00992},
year = {2016}
}