中文

利用远程监督引导文本匿名化模型

计算与语言 2022-05-17 v1

摘要

我们提出一种基于远程监督引导文本匿名化模型的新颖方法。该方法不要求人工标注的训练数据,而是依赖于表达假定公开可用的关于不同个体的背景信息的知识图谱。该知识图谱用于自动标注包含关于这些个体子集个人数据的文本文档。更确切地说,该方法在确定应被掩码的文本跨度以保证kk-匿名性,假设攻击者同时可访问文本文档与知识图谱中表达的背景信息。所得标注文档集合随后用作训练数据,以微调用于文本匿名化的预训练语言模型。我们使用从Wikidata提取的知识图谱与来自Wikipedia的短传记文本来说明该方法。基于RoBERTa的模型与人工标注的553篇摘要集合的评估结果显示了该方法的潜力,但也揭示了若知识图谱含噪或不完整时可能出现的若干问题。结果还表明,与多数序列标注问题相反,文本匿名化任务可能允许多种替代解。

关键词

引用

@article{arxiv.2205.06895,
  title  = {Bootstrapping Text Anonymization Models with Distant Supervision},
  author = {Anthi Papadopoulou and Pierre Lison and Lilja Øvrelid and Ildikó Pilán},
  journal= {arXiv preprint arXiv:2205.06895},
  year   = {2022}
}