针对自回归语言模型的无训练强大成员推断攻击
计算与语言
2026-04-14 v2 人工智能
密码学与安全
摘要
微调后的语言模型存在显著的隐私风险,因为它们可能记忆并泄露训练数据中的敏感信息。成员推断攻击(MIAs)为审计这些风险提供了原则性框架,但现有方法检测率有限,尤其是在实际隐私审计所需的低假阳性率阈值下。我们提出了EZ-MIA,一种成员推断攻击,它利用了一个关键观察:记忆在错误位置表现最为强烈,具体而言,是模型预测错误但训练样本仍显示较高概率的token。我们引入了错误区域(EZ)分数,该分数衡量相对于预训练参考模型,在错误位置概率变化的方向性不平衡。这一原则性统计量每次查询仅需两次前向传播,且无需任何模型训练。在WikiText数据集上使用GPT-2,在相同条件下(1%假阳性率下真阳性率66.3%对比17.5%),EZ-MIA的检测率比先前最先进方法高3.8倍,并实现了近乎完美的区分(AUC 0.98)。在现实世界审计至关重要的严格0.1% FPR阈值下,我们的检测率比先前工作高8倍(14.0%对比1.8%),且无需训练参考模型。这些优势扩展到更大的架构:在AG News数据集上使用Llama-2-7B,我们在1% FPR下实现了3倍更高的检测率(46.7%对比15.8% TPR)。这些结果表明,微调语言模型的隐私风险远高于先前认知,这对隐私审计和部署决策都具有重要意义。代码可在https://github.com/JetBrains-Research/ez-mia获取。
引用
@article{arxiv.2601.12104,
title = {Powerful Training-Free Membership Inference Against Autoregressive Language Models},
author = {David Ilić and David Stanojević and Kostadin Cvejoski},
journal= {arXiv preprint arXiv:2601.12104},
year = {2026}
}
备注
9 pages, 2 figures; appendix with additional experiments and derivations