中文

AttenMIA:通过注意力信号实现的大语言模型成员推断攻击

机器学习 2026-01-27 v1

摘要

大语言模型 (LLM) 越来越多地被部署以支持或改进众多实际应用。鉴于其训练数据集的庞大规模,模型记忆训练数据的倾向引发了严重的隐私和知识产权问题。一个关键威胁是成员推断攻击 (MIA),其目标是确定给定样本是否包含在模型的训练集中。现有的针对 LLM 的 MIA 主要依赖于输出置信度分数或基于嵌入的特征,但这些信号通常很脆弱,导致攻击成功率有限。我们引入了 AttenMIA,一种新的 MIA 框架,它利用 Transformer 模型内部的自注意力模式来推断成员关系。注意力控制着 Transformer 内部的信息流,揭示了不同的记忆模式,可用于识别数据集的成员。我们的方法利用来自各层注意力头的信息,并将其与基于扰动的散度指标相结合,以训练一个有效的 MIA 分类器。通过对包括 LLaMA-2、Pythia 和 Opt 模型在内的开源模型进行大量实验,我们表明基于注意力的特征持续优于基线方法,特别是在重要的低误报率指标下(例如,在 Llama2-13b 的 WikiMIA-32 基准测试上实现了高达 0.996 的 ROC AUC 和 87.9% 的 TPR@1%FPR)。我们展示了注意力信号能够跨数据集和架构泛化,并提供了成员泄露最显著的层和注意力头级别的分析。我们还表明,在数据提取框架中使用 AttenMIA 替代其他成员推断攻击,可以产生优于现有技术水平的数据提取攻击。我们的发现揭示了最初为增强可解释性而引入的注意力机制,可能会无意中放大 LLM 中的隐私风险,这凸显了开发新防御措施的必要性。

关键词

引用

@article{arxiv.2601.18110,
  title  = {AttenMIA: LLM Membership Inference Attack through Attention Signals},
  author = {Pedram Zaree and Md Abdullah Al Mamun and Yue Dong and Ihsen Alouani and Nael Abu-Ghazaleh},
  journal= {arXiv preprint arXiv:2601.18110},
  year   = {2026}
}