中文

文本匿名化基准(TAB):面向文本匿名化的专用语料库与评估框架

计算与语言 2022-07-04 v2 人工智能

摘要

我们提出了一种用于评估文本匿名化方法性能的新基准及相应的评估指标。文本匿名化定义为编辑文本文档以防止个人信息泄露的任务,目前缺乏面向隐私的标注文本资源,难以妥善评估各种匿名化方法所提供的隐私保护水平。本文提出 TAB(文本匿名化基准),一个为弥补该短缺而开发的新型开源标注语料库。该语料库包含来自欧洲人权法院(ECHR)的 1,268 篇英文判例,并 enriched with 关于每篇文档中出现的个人信息的全面标注,包括其语义类别、标识符类型、机密属性和共指关系。与以往工作相比,TAB 语料库旨在超越传统的去标识化(仅限于预定义语义类别的检测),并明确标记应被掩码的文本跨度以隐藏受保护人员的身份。在介绍语料库及其标注层的同时,我们还提出了一组专门量身定制用于衡量文本匿名化性能的评估指标,涵盖隐私保护与效用保持两方面。我们通过评估若干基线文本匿名化模型的经验性能来展示该基准与所提指标的使用。完整语料库及其面向隐私的标注指南、评估脚本和基线模型可在 https://github.com/NorskRegnesentral/text-anonymisation-benchmark 获取。

关键词

引用

@article{arxiv.2202.00443,
  title  = {The Text Anonymization Benchmark (TAB): A Dedicated Corpus and Evaluation Framework for Text Anonymization},
  author = {Ildikó Pilán and Pierre Lison and Lilja Øvrelid and Anthi Papadopoulou and David Sánchez and Montserrat Batet},
  journal= {arXiv preprint arXiv:2202.00443},
  year   = {2022}
}