无入侵者,无有效性:隐私保护文本匿名化的评估准则
计算与语言
2021-03-18 v1
摘要
为使敏感文本数据能在 NLP 研究人员与从业者之间共享,共享文档需符合数据保护与隐私法规。因此,对自动化文本匿名化方法的兴趣日益增长。然而,衡量此类方法的性能颇具挑战:遗漏单个识别属性便可能暴露个体身份。本文中,我们提请注意该问题,并主张开发自动化文本匿名化系统的研究人员与从业者应仔细评估其评估方法是否真正反映系统保护个体免于被重新识别的能力。我们随后提出 TILD,一组评估准则,包含匿名化方法的技术性能、由其匿名化导致的信息损失,以及人类对删改文档去匿名化的能力。这些准则或可推动迈向衡量匿名化性能的标准化方法。
引用
@article{arxiv.2103.09263,
title = {No Intruder, no Validity: Evaluation Criteria for Privacy-Preserving Text Anonymization},
author = {Maximilian Mozes and Bennett Kleinberg},
journal= {arXiv preprint arXiv:2103.09263},
year = {2021}
}
备注
pre-print; under review