针对大语言模型成员推理攻击的自动校准
机器学习
2025-05-07 v1 人工智能
摘要
成员推理攻击(MIAs)最近被用于判断特定文本是否属于大语言模型(LLMs)预训练数据的一部分。然而,现有方法常常将非成员误判为成员,导致较高的假阳性率,或者依赖额外的参考模型进行概率校准,这限制了它们的实用性。为了克服这些挑战,我们引入了一个名为自动校准成员推理攻击(ACMIA)的新框架,该框架利用可调温度来有效校准输出概率。这种方法源于我们对LLMs预训练期间最大似然估计的理论洞察。我们以三种配置引入ACMIA,旨在适应不同级别的模型访问权限,并增大成员与非成员之间的概率差距,从而提高成员推理的可靠性和鲁棒性。在各种开源LLMs上的大量实验表明,我们提出的攻击方法高效、鲁棒且泛化能力强,在三个广泛使用的基准测试中超越了最先进的基线方法。我们的代码可在以下地址获取:\href{https://github.com/Salehzz/ACMIA}{\textcolor{blue}{Github}}。
引用
@article{arxiv.2505.03392,
title = {Automatic Calibration for Membership Inference Attack on Large Language Models},
author = {Saleh Zare Zade and Yao Qiang and Xiangyu Zhou and Hui Zhu and Mohammad Amin Roshani and Prashant Khanduri and Dongxiao Zhu},
journal= {arXiv preprint arXiv:2505.03392},
year = {2025}
}