基于推理攻击的真实文本净化
计算与语言
2025-09-03 v2
摘要
文本净化旨在重写文档的部分内容以防止个人信息泄露。文本净化的核心挑战是在隐私保护(避免个人信息泄露)和效用保持(尽可能保留文档原始内容)之间取得平衡。为此,我们引入了一种基于泛化的新型文本净化方法,即使用更宽泛但仍包含信息的术语来涵盖原始文本片段的语义内容。该方法依赖于指令微调的大型语言模型(LLM),分为两个阶段。给定一个包含个人身份信息(PII)文本片段的文档,首先应用LLM为每个文本片段获取保持真实的替换候选,并根据其抽象级别进行排序。然后,通过使用LLM进行推理攻击来评估这些候选的隐私保护能力。最后,系统选择对攻击具有抵抗力的信息量最大的替换候选。这个两阶段过程产生的替换有效地平衡了隐私和效用。我们还提出了新的度量标准来评估这两个方面,无需手动标注文档。在文本匿名化基准上的结果表明,使用Mistral 7B Instruct实现的方法提高了效用,与完全抑制原始片段相比,重新识别风险仅略有增加(<1个百分点)。此外,我们的方法比现有方法(如Microsoft Presidio的合成替换)更真实。
引用
@article{arxiv.2412.12928,
title = {Truthful Text Sanitization Guided by Inference Attacks},
author = {Ildikó Pilán and Benet Manzanares-Salor and David Sánchez and Pierre Lison},
journal= {arXiv preprint arXiv:2412.12928},
year = {2025}
}