中文

基于深度学习方法的欺诈调查中的暗语检测

计算与语言 2021-03-18 v1 人工智能

摘要

在现代诉讼中,欺诈调查人员经常面临在案件处理过程中必须审阅的海量文件。在大多数法律案件中,欺诈调查人员事先并不确切知道他们在寻找什么,也不知道去哪里寻找。此外,欺诈者可能通过使用暗语来隐藏其行为与意图。实际上,这意味着欺诈调查人员是在不知针为何物的情况下大海捞针。作为一项更大型研究计划的一部分,我们使用一个框架来加快调查进程,应用文本挖掘与机器学习技术。我们使用欺诈调查中三种著名的方法来构建该框架:(i) 欺诈三角,(ii) 黄金(“W”)调查问题,以及 (iii) 竞争假设分析。借助该框架,可以自动组织调查数据,从而让调查人员更易于找到典型调查问题的答案。在本研究中,我们聚焦于该框架的一个组成部分:识别欺诈者对暗语的使用。为此,我们创建了一个新颖的(已标注的)合成数据集,其中此类暗语隐藏于正常邮件通信中。随后,采用一系列机器学习技术来检测此类暗语。我们表明,最先进的 BERT 模型在此任务上显著优于其他方法。基于该结果,我们证明深度神经语言模型可可靠地(F1 分数为 0.9)应用于欺诈调查中的暗语检测。

关键词

引用

@article{arxiv.2103.09606,
  title  = {Code Word Detection in Fraud Investigations using a Deep-Learning Approach},
  author = {Youri van der Zee and Jan C. Scholtes and Marcel Westerhoud and Julien Rossi},
  journal= {arXiv preprint arXiv:2103.09606},
  year   = {2021}
}