中文

大语言模型是否真的会记忆个人可识别信息?基于提示控制记忆框架的重新审视

计算与语言 2026-01-08 v1 人工智能

摘要

大语言模型 (LLM) 被报告会“泄露”个人可识别信息 (PII),成功的 PII 重建常被解读为记忆的证据。我们提出了 LLM 记忆评估的原则性修订,认为 PII 泄露应在低词汇提示条件下进行,即目标 PII 无法通过提示诱导的泛化或模式完成进行重建。我们形式化了提示抗记忆 (CRM) 作为一种提示控制的评估框架和有效记忆评估的必要条件,明确在提示-目标重叠提示下进行条件化。在 CRM 框架下,我们对 PII 泄露进行大规模多语言重新评估,覆盖 32 种语言和多种记忆范式。重新审视基于重建的设置,包括字面前缀-后缀完成和关联重建,我们发现其显著效果主要来自直接的表面形式提示,而非真正的记忆。当这些提示被控制后,重建成功率显著下降。我们进一步检查无提示生成和成员推断,这两种方法的真阳性率极低。总体而言,我们的结果表明,之前报告的 PII 泄露更可能是由提示驱动的行为解释,而非真实的记忆,这突显了在 LLM 中可靠量化与隐私相关记忆的重要性,必须采用提示控制评估方法。

关键词

引用

@article{arxiv.2601.03791,
  title  = {Do LLMs Really Memorize Personally Identifiable Information? Revisiting PII Leakage with a Cue-Controlled Memorization Framework},
  author = {Xiaoyu Luo and Yiyi Chen and Qiongxiu Li and Johannes Bjerva},
  journal= {arXiv preprint arXiv:2601.03791},
  year   = {2026}
}

备注

20 pages, 13 figures