中文

语言模型中的个人信息模仿

计算与语言 2026-02-25 v1 人工智能 密码学与安全 机器学习

摘要

现代语言模型 (LM) 在大规模网络抓取数据上进行训练,包含数百万个人信息 (PI) 实例,其中许多 LM 会记忆这些实例,增加了隐私风险。本文我们开发了基于正则表达式和规则 (R&R) 检测器套件,用于检测电子邮件地址、电话号码和 IP 地址,该检测器超越了最佳基于正则表达式的 PI 检测器。在一组手动精选的 483 个 PI 实例上,我们衡量记忆:发现 13.6% 的实例被 Pythia-6.9b 模型逐字模仿,即当模型被提示输入在原始文档中 PI 之前的标记时,greedy 解码会生成整个 PI 跨度的确切文本。我们扩展了这一分析,以研究不同大小 (160M-6.9B) 和预训练时间步 (70k-143k) 的 Pythia 模型套件,发现模型规模和预训练量都与记忆正相关。即使最小的模型 Pythia-160m 也会模仿 2.7% 的实例。因此,我们强烈建议在预训练数据集中积极过滤和匿名化,以最小化 PI 模仿。

关键词

引用

@article{arxiv.2602.20580,
  title  = {Personal Information Parroting in Language Models},
  author = {Nishant Subramani and Kshitish Ghate and Mona Diab},
  journal= {arXiv preprint arXiv:2602.20580},
  year   = {2026}
}

备注

EACL Findings 2026