中文

面向法律文本的去标识化

计算与语言 2019-10-10 v1

摘要

在许多国家,可发布或在机构间共享的个人信息受到监管,因此文档必须经过去标识化过程以消除或混淆机密数据。我们的工作聚焦于法律文本的去标识化,其目标是在不丢失故事语义的前提下隐藏诉讼参与方的名称。我们针对分词、标记化和命名实体识别等任务,在我们的语料库上对NLP工具进行了首次评估,并分析了若干用于去标识化任务的评价指标。结果不容乐观:84%的文档至少有一个未被NER工具覆盖的名称,这可能导致相关名称被重新识别。我们得出结论,工具必须经过强力适配才能处理这一特定领域的文本。

关键词

引用

@article{arxiv.1910.03739,
  title  = {Towards De-identification of Legal Texts},
  author = {Diego Garat and Dina Wonsever},
  journal= {arXiv preprint arXiv:1910.03739},
  year   = {2019}
}