中文

PII-Compass:通过 grounding 指引大语言模型训练数据提取提示聚焦于目标个人可识别信息

密码学与安全 2025-08-26 v2 人工智能 计算与语言 机器学习

摘要

最新且最具影响力的大模型进展源于其规模的增加。然而,这导致记忆能力的提升,引发数据隐私担忧。具体而言,研究表明模型可以输出其训练数据中包含的个人可识别信息(PII)。然而,报告的 PII 提取性能差异很大,没有关于评估该风险的最优方法性共识,导致对现实对手的低估。在本工作中,我们实证证明,通过对手动构建的提取提示前缀进行 grounding,可以将 PII 的可提取性提高十倍以上。我们的方法 PII-Compass 在获取 1、128 和 2308 个查询时,分别实现了 0.92%、3.9% 和 6.86% 的电话号码提取率,即每 15 个人中就有 1 个人的电话号码可被提取。

关键词

引用

@article{arxiv.2407.02943,
  title  = {PII-Compass: Guiding LLM training data extraction prompts towards the target PII via grounding},
  author = {Krishna Kanth Nakka and Ahmed Frikha and Ricardo Mendes and Xue Jiang and Xuebing Zhou},
  journal= {arXiv preprint arXiv:2407.02943},
  year   = {2025}
}

备注

Accepted at PrivateNLP Workshop at ACL 2024