无监督文本去标识化
计算与语言
2022-10-24 v1
摘要
去标识化旨在分发前对文本数据进行匿名化处理。自动去标识化主要使用基于人工标注数据点的有监督命名实体识别。我们提出一种无监督去标识化方法,该方法对泄露个人身份信息的词进行掩码。该方法利用一个经专门训练的再标识模型,从被删改的个人文档中识别个体。受基于 K-匿名的隐私保护启发,我们生成确保文档正确档案的最小再标识排位的删改结果。为评估该方法,我们考虑对维基百科传记进行去标识化任务,并使用对抗性再标识度量进行评估。与一组无监督基线相比,我们的方法在删除更少词的同时更彻底地对文档进行去标识化。从定性上看,我们发现该方法消除了许多超出常见基于命名实体的方法范围的标识性特征。
引用
@article{arxiv.2210.11528,
title = {Unsupervised Text Deidentification},
author = {John X. Morris and Justin T. Chiu and Ramin Zabih and Alexander M. Rush},
journal= {arXiv preprint arXiv:2210.11528},
year = {2022}
}
备注
Findings of EMNLP 2022