中文

面向金融机构的高吞吐神经网络模型敏感数据检测

机器学习 2020-12-18 v1

摘要

命名实体识别已在许多领域得到广泛研究。然而,由于缺少公开可用的标注数据集,金融机构生产系统中敏感实体检测的应用尚未得到充分探索。在本文中,我们使用内部和合成数据集,评估在非结构化和结构化数据格式中检测金融机构常见的 NPI(非公开个人身份识别)信息的多种方法。我们在两个预测任务上研究了字符级神经网络模型,包括 CNN、LSTM、BiLSTM-CRF 和 CNN-CRF:(i)多数据格式上的实体检测,以及(ii)表格数据集上的列级实体预测。我们在真实和合成数据上,针对 F1 分数、精确率、召回率和吞吐量,将这些模型与其他标准方法进行比较。真实数据集包括内部结构化数据和带人工标注标签的公开邮件数据。我们的实验结果表明,CNN 模型在准确率和吞吐量方面简单而有效,因此是部署在生产环境中最合适的候选模型。最后,我们提供了关于数据局限性、数据标注以及数据实体内在重叠的若干经验教训。

关键词

引用

@article{arxiv.2012.09597,
  title  = {Sensitive Data Detection with High-Throughput Neural Network Models for Financial Institutions},
  author = {Anh Truong and Austin Walters and Jeremy Goodsitt},
  journal= {arXiv preprint arXiv:2012.09597},
  year   = {2020}
}