中文

能否从 LLM 推断训练数据的机密属性?

机器学习 2026-02-10 v4 计算与语言 密码学与安全

摘要

大语言模型(LLMs)越来越多地在领域特定数据集上进行微调,以支持医疗、金融和法律等领域的应用。这些微调数据集通常具有敏感且机密的数据集级属性——如患者人口统计信息或疾病患病率——这些信息并不打算被泄露。虽然先前工作已研究了判别模型(如图像分类模型)和生成模型(如用于图像数据的 GAN)上的属性推断攻击,但尚不清楚此类攻击是否适用于 LLMs。在本工作中,我们引入了 PropInfer,一个用于评估 LLM 在两种微调范式——问答和对话补全——下属性推断的基准任务。基于 ChatDoctor 数据集,我们的基准涵盖了多种属性类型和任务配置。我们进一步提出了两种针对性攻击:基于提示的生成攻击和利用词频信号的影子模型攻击。在多个预训练 LLM 上的经验评估展示了我们攻击的成功,揭示了 LLM 中一个此前未被识别的漏洞。

关键词

引用

@article{arxiv.2506.10364,
  title  = {Can We Infer Confidential Properties of Training Data from LLMs?},
  author = {Pengrun Huang and Chhavi Yadav and Kamalika Chaudhuri and Ruihan Wu},
  journal= {arXiv preprint arXiv:2506.10364},
  year   = {2026}
}