神经线索:通过隐藏状态和注意力模式分析的大语言模型成员推断攻击
机器学习
2025-09-09 v1 人工智能
摘要
成员推断攻击(Membership Inference Attacks, MIAs)揭示特定数据是否用于训练机器学习模型,作为隐私审计和合规性评估的重要工具。近期研究表明,针对大型语言模型的 MIAs 只略微优于随机猜测,这暗示现代预训练方法在海量数据集上可能不具备隐私泄露风险。我们的工作从另一个角度出发,探讨如何通过检查大语言模型的内部表示(而不仅仅是其输出),可为潜在的成员推断信号提供额外见解。我们的框架 \emph{memTrace} 遵循我们称之为 \enquote{neural breadcrumbs} 的概念,从变换器隐藏状态和注意力模式中提取信息性信号。通过分析层级表示动态、注意力分布特征以及跨层转换模式,我们检测到来自传统基于损失的方法可能无法捕捉的记忆指纹。该方法在多个模型家族上实现了强大的成员检测能力,在流行的 MIA 基准测试中平均 AUC 可达 0.85。我们的发现表明,即使在基于输出的信号看似受保护的情况下,内部模型行为也能透露出训练数据暴露的某些方面,凸显了进一步研究成员隐私以及开发更健壮大语言模型隐私保留训练技术的必要性。
引用
@article{arxiv.2509.05449,
title = {Neural Breadcrumbs: Membership Inference Attacks on LLMs Through Hidden State and Attention Pattern Analysis},
author = {Disha Makhija and Manoj Ghuhan Arivazhagan and Vinayshekhar Bannihatti Kumar and Rashmi Gangadharaiah},
journal= {arXiv preprint arXiv:2509.05449},
year = {2025}
}