从监督微调模型重建可识别个人信息
密码学与安全
2026-05-13 v1 计算与语言
机器学习
摘要
监督微调(SFT)已成为使用大量预训练知识适应大语言模型(LLM)以执行特定于领域、遵循指令任务的主要方法之一。SFT 数据集由指令-响应对组成,常包括用户提供的可能包含个人可识别信息(PII)的敏感数据,这引发了隐私 concerns。本文首次研究从 SFT 模型重建 PII 的问题。我们构建包含 PII 的多轮、以用户为中心的 Q&A 数据集,具体针对医疗和法律领域,以实现对泄露的真实评估。使用这些数据集,我们评估了具有不同水平关于微调数据集知识的对手,能否从中推断用于 SFT 的个人数据。 在重建场景中,我们提出了 COVA(a novel decoding algorithm to reconstruct PII under prefix-based attacks),持续优于现有提取方法。我们的结果表明,即使部分攻击者知识也能显著提高重建成功率,而泄露在不同 PII 类型之间差异很大。
引用
@article{arxiv.2605.12264,
title = {Reconstruction of Personally Identifiable Information from Supervised Finetuned Models},
author = {Sae Furukawa and Alina Oprea},
journal= {arXiv preprint arXiv:2605.12264},
year = {2026}
}