基于大语言模型的数据重建之双刃剑:理解与缓解词级差分隐私文本脱敏中的上下文脆弱性
密码学与安全
2025-08-27 v1 计算与语言
摘要
差分隐私文本脱敏是指在差分隐私(DP)框架下对文本进行私有化处理的过程,它提供可证明的隐私保证,同时也能在经验上防御试图损害隐私的对手。尽管词级操作的DP文本脱敏方法较为简单,但它们存在若干缺点,其中之一是由于脱敏过程中的随机化而倾向于留下原始文本的上下文线索——我们将其称为“上下文脆弱性”。鉴于大语言模型(LLMs)强大的上下文理解与推理能力,我们探索了LLMs在多大程度上可被利用来攻击DP脱敏文本的上下文脆弱性。我们不仅在采用先进LLMs方面,还在更广泛的隐私级别上测试更多样的脱敏机制方面,扩展了先前的工作。我们的实验揭示了基于LLM的数据重建攻击对隐私和效用产生的双刃剑效应:虽然LLMs确实能够推断原始语义,有时会削弱经验隐私保护,但它们也可被用于善途,即改善DP脱敏文本的质量和隐私性。基于我们的发现,我们提出将LLM数据重建作为后处理步骤的建议,通过对抗性思维来增强隐私保护。
引用
@article{arxiv.2508.18976,
title = {The Double-edged Sword of LLM-based Data Reconstruction: Understanding and Mitigating Contextual Vulnerability in Word-level Differential Privacy Text Sanitization},
author = {Stephen Meisenbacher and Alexandra Klymenko and Andreea-Elena Bodea and Florian Matthes},
journal= {arXiv preprint arXiv:2508.18976},
year = {2025}
}
备注
15 pages, 4 figures, 8 tables. Accepted to WPES @ CCS 2025