基于自回归填充的去识别文档重新识别
计算与语言
2025-05-20 v1
摘要
揭露有关个人敏感信息的文档通常必须进行去识别处理。这种去识别通常通过屏蔽所有个人可识别信息(PII)的提及来完成,从而使更难揭示相关个人的身份。在探讼去识别方法鲁棒性时,我们提出了一种新颖的、受 RAG 启发的方法,旨在基于代表背景知识的数据库进行反向的重新识别过程。给定一段个人标识已被掩码处理的文本,重新识别过程分为两个步骤。首先,检索器从背景知识中选取被认为有助于重新识别的相关段落。然后,这些段落被提供给填充模型,以推断每个文本片段的原始内容。该过程被重复直到所有被掩码的文本片段被替换。我们在三个数据集上评估了重新识别:维基百科传记、法院裁决和临床记录。结果表明:(1)可成功恢复高达 80% 的去识别文本片段,(2)随着背景知识水平的提高,重新识别准确率也随之提高。
引用
@article{arxiv.2505.12859,
title = {Re-identification of De-identified Documents with Autoregressive Infilling},
author = {Lucas Georges Gabriel Charpentier and Pierre Lison},
journal= {arXiv preprint arXiv:2505.12859},
year = {2025}
}
备注
To be presented a ACL 2025, Main, Long paper