中文

噪声邻居:针对大语言模型的高效成员推断攻击

密码学与安全 2024-06-25 v1 机器学习

摘要

基于变换器的大语言模型(LLM)的潜在价值因依赖大规模数据集,可能包含敏感信息而受到隐私顾虑的制约。像 GDPR 和 CCPA 这样的监管措施要求使用稳健的审计工具来解决潜在的隐私问题,而成员推断攻击(MIA)是评估 LLM 隐私风险的主要方法。不同于传统 MIA 方法通常需要对额外模型进行计算密集型训练本文引入一种高效方法,通过在嵌入空间中添加随机噪声生成目标样本的“噪声邻居”,仅需以推理模式运行目标模型即可实现。我们的发现表明,这种方法在效果上与使用影子模型相当,显示其在实际隐私审计场景中的可用性。

关键词

引用

@article{arxiv.2406.16565,
  title  = {Noisy Neighbors: Efficient membership inference attacks against LLMs},
  author = {Filippo Galli and Luca Melis and Tommaso Cucinotta},
  journal= {arXiv preprint arXiv:2406.16565},
  year   = {2024}
}