中文

PII-Scope:面向大语言模型的训练数据 PII 提取攻击全面研究

计算与语言 2025-05-27 v2 人工智能 机器学习

摘要

本文介绍 PII-Scope,一个全面的基准测试,旨在评估针对大语言模型(LLM)的 PII 提取攻击在多样化威胁情景下的最新方法。我们的研究通过揭示若干超参数(如示例选择)对攻击效果的关键作用,深入理解了这些攻击。基于此理解,我们将研究扩展至更真实的攻击情景,探索采用高级对抗策略的 PII 攻击,包括重复且多样化的查询,以及利用迭代学习实现持续 PII 提取。通过大规模实验,我们发现现有单查询攻击对 PII 漏洞的估计明显低估。实际上,我们展示在有限查询预算下,凭借精熟的对抗能力,针对预训练模型的 PII 提取率可提高最高可达五倍。此外,我们评估了 PII 在微调模型上的泄露情况,发现其比预训练模型更易受泄露。总体而言,本工作为真实威胁情景下 PII 提取攻击建立了严谨的实证基准,为开发有效的缓解策略提供了坚实基础。

关键词

引用

@article{arxiv.2410.06704,
  title  = {PII-Scope: A Comprehensive Study on Training Data PII Extraction Attacks in LLMs},
  author = {Krishna Kanth Nakka and Ahmed Frikha and Ricardo Mendes and Xue Jiang and Xuebing Zhou},
  journal= {arXiv preprint arXiv:2410.06704},
  year   = {2025}
}

备注

Additional results with Pythia6.9B; Additional results with Phone number PII;