中文

西班牙语临床文本中的敏感数据检测与分类:基于 BERT 的实验

计算与语言 2020-03-18 v2

摘要

海量数字数据处理提供了广泛的机会和益处,但代价是危及个人数据隐私。匿名化包括从数据中移除或替换敏感信息,使其能够在保护个人隐私的同时用于不同目的。多年来,已提出许多自动匿名化系统;然而,取决于数据类型、目标语言或训练文档的可用性,该任务仍然具有挑战性。过去两年新型深度学习模型的出现给自然语言处理领域的最先进水平带来了巨大改进。这些进展最显著地由 BERT(Google 于 2018 年提出的模型)以及在数百万文档上预训练的共享语言模型引领。在本文中,我们使用基于 BERT 的序列标注模型在多个西班牙语临床数据集上进行一系列匿名化实验。我们还将 BERT 与其他算法进行比较。实验表明,具有通用领域预训练的简易基于 BERT 的模型无需任何领域特定特征工程即可获得极具竞争力的结果。

关键词

引用

@article{arxiv.2003.03106,
  title  = {Sensitive Data Detection and Classification in Spanish Clinical Text: Experiments with BERT},
  author = {Aitor García-Pablos and Naiara Perez and Montse Cuadros},
  journal= {arXiv preprint arXiv:2003.03106},
  year   = {2020}
}

备注

Accepted at 12th Edition of Language Resources and Evaluation Conference (LREC2020)