中文

带隐私风险指示器的神经文本净化:一项实证分析

计算与语言 2023-10-24 v1

摘要

文本净化是指编辑文档以遮蔽所有(直接或间接)个人标识符出现的任务,旨在隐藏文档中所指个体的身份。本文中,我们考虑一种两步式文本净化方法,并详细分析其在两个近期发布的数据集上的实证表现:Text Anonymization Benchmark(Pil\'an 等,2022)和一组维基百科传记(Papadopoulou 等,2022)。文本净化过程始于一个面向隐私的实体识别器,其试图确定表达可识别个人信息的文本跨度。该面向隐私的实体识别器通过结合一个标准命名实体识别模型与一个由从 Wikidata 提取的与人相关术语填充的地名词典来训练。文本净化过程的第二步是评估与每个检测到的文本跨度(孤立地或与其他文本跨度组合)相关的隐私风险。我们提出五种再识别风险的不同指示器,分别基于语言模型概率、文本跨度分类、序列标注、扰动和网页搜索。我们对每个隐私指示器进行了对比分析,并强调了它们的优势与局限,尤其是相对于可用标注数据而言。

关键词

引用

@article{arxiv.2310.14312,
  title  = {Neural Text Sanitization with Privacy Risk Indicators: An Empirical Analysis},
  author = {Anthi Papadopoulou and Pierre Lison and Mark Anderson and Lilja Øvrelid and Ildikó Pilán},
  journal= {arXiv preprint arXiv:2310.14312},
  year   = {2023}
}