中文

微调语言模型中敏感信息的非预期记忆

机器学习 2026-01-27 v1 人工智能 计算与语言

摘要

在敏感数据集上微调大型语言模型 (LLM) 带来了非预期记忆和个人身份信息 (PII) 泄露的巨大风险,这可能违反隐私法规并危及个人安全。在这项工作中,我们系统地调查了一个关键且尚未充分探索的漏洞:仅出现在模型输入而非训练目标中的 PII 的暴露。使用合成和真实世界数据集,我们设计了受控提取探针来量化非预期的 PII 记忆,并研究语言、PII 频率、任务类型和模型大小等因素如何影响记忆行为。我们进一步对四种隐私保护方法进行了基准测试,包括差分隐私、机器遗忘、正则化和偏好对齐,评估了它们在隐私和任务性能之间的权衡。我们的结果表明,训练后方法通常提供更一致的隐私-效用权衡,而差分隐私在特定设置下实现了泄露的大幅减少,尽管它可能引入训练不稳定性。这些发现突出了微调 LLM 中记忆的持久挑战,并强调了对稳健、可扩展的隐私保护技术的需求。

关键词

引用

@article{arxiv.2601.17480,
  title  = {Unintended Memorization of Sensitive Information in Fine-Tuned Language Models},
  author = {Marton Szep and Jorge Marin Ruiz and Georgios Kaissis and Paulina Seidl and Rüdiger von Eisenhart-Rothe and Florian Hinterwimmer and Daniel Rueckert},
  journal= {arXiv preprint arXiv:2601.17480},
  year   = {2026}
}

备注

Accepted to EACL 2026. 20 pages