G-Drift MIA:通过梯度诱导特征漂移进行LLM成员推断
机器学习
2026-04-02 v1 人工智能
摘要
大语言模型(LLM)在海量网络规模语料上训练,引发了日益增长的隐私和版权担忧。成员推断攻击(MIA)旨在判断给定样本是否用于训练。现有的LLM MIA主要依赖输出概率或损失值,当成员和非成员来自同一分布时,性能通常仅略优于随机猜测。我们提出了G-Drift MIA,一种基于梯度诱导特征漂移的白盒成员推断方法。对于候选样本 ,我们执行单步定向梯度上升以增加其损失,并测量更新前后内部表征的变化,包括logits、隐藏层激活和投影到固定特征方向的变化。这些漂移信号用于训练一个轻量逻辑分类器,有效区分成员与非成员。在多个基于Transformer的LLM和来自真实MIA基准的数据集上,G-Drift显著优于基于置信度、困惑度和基于参考的攻击。我们进一步表明,记忆的训练样本系统性地表现出比非成员更小且更具结构性的特征漂移,在梯度几何、表征稳定性和记忆化之间建立了机制性联系。总之,我们的结果表明,小规模受控梯度干预为审计训练数据成员和评估LLM隐私风险提供了实用工具。
引用
@article{arxiv.2604.00419,
title = {G-Drift MIA: Membership Inference via Gradient-Induced Feature Drift in LLMs},
author = {Ravi Ranjan and Utkarsh Grover and Xiaomin Lin and Agoritsa Polyzou},
journal= {arXiv preprint arXiv:2604.00419},
year = {2026}
}
备注
14 pages, 3 figures and tables. Accepted in ICPR-2026 conference, to appear in the Springer LNCS proceedings