LLM 成员推理的速度提升数个数量级
机器学习
2024-09-25 v2 密码学与安全
机器学习
摘要
大型语言模型有望彻底改变广泛的计算领域,但其复杂性和海量的训练数据也暴露了显著的隐私漏洞。与 LLM 相关的最简单的隐私风险之一是它们容易受到成员推理攻击的影响,其中攻击者旨在确定特定数据点是否属于模型的训练集。尽管这是一个已知风险,但当前最先进的 MIA 方法依赖于训练多个计算成本高昂的影子模型,使得大模型的风险评估变得不可行。在这里,我们调整了最近一条使用分位数回归进行成员推理攻击的研究路线;我们扩展了这项工作,提出了一种低成本的 MIA,它利用小型分位数回归模型的集成来确定文档是否属于模型的训练集。我们在不同系列(OPT、Pythia、Llama)的微调 LLM 和多个数据集上证明了这种方法的有效性。在所有场景中,与最先进的影子模型方法相比,我们获得了相当或提高的准确率,且仅使用了其 6% 的计算预算。我们证明了在多轮训练的目标模型上有效性的提升,以及对架构误设的鲁棒性,也就是说,我们可以对使用不同分词器和架构的模型发起有效攻击,而无需了解目标模型。
引用
@article{arxiv.2409.14513,
title = {Order of Magnitude Speedups for LLM Membership Inference},
author = {Rongting Zhang and Martin Bertran and Aaron Roth},
journal= {arXiv preprint arXiv:2409.14513},
year = {2024}
}