学习自回归语言模型中记忆化的特征
摘要
所有针对微调语言模型的先前成员推断攻击均使用手工设计的启发式方法(如损失阈值、Min-K%、参考校准),每种方法都受限于设计者的直觉。我们引入了首个可迁移的学习攻击,其依据的观察是:在任何语料库上微调任何模型都会产生无限的标记数据,因为成员身份在构造上是已知的。这消除了影子模型瓶颈,并将成员推断带入深度学习时代:学习什么重要而非设计它,通过训练多样性和规模实现泛化。我们发现,微调语言模型会产生一种可跨架构族和数据域检测的不变记忆化特征。我们仅在基于 Transformer 的模型上训练成员推断分类器。它以零样本迁移到 Mamba(状态空间)、RWKV-4(线性注意力)和 RecurrentGemma(门控循环),分别达到 0.963、0.972 和 0.936 的 AUC。每次评估都结合了训练期间从未见过的架构和数据集,但三者均超过了在保留 Transformer 上的性能(0.908 AUC)。这四个族没有共享任何计算机制,它们唯一的共同点是交叉熵损失上的梯度下降。即使是简单的基于似然的方法也表现出强大的迁移能力,确认了该特征独立于检测方法而存在。我们的方法 Learned Transfer MIA(LT-MIA)通过将成员推断重构为逐标记分布统计上的序列分类,最有效地捕获了这一信号。在 Transformer 上,LT-MIA 在 0.1% FPR 下的 TPR 比最强基线高出 2.8 倍。该方法还迁移到代码(0.865 AUC),尽管仅在自然语言文本上进行训练。代码和训练好的分类器可在 https://github.com/JetBrains-Research/learned-mia 获取。
引用
@article{arxiv.2604.03199,
title = {Learning the Signature of Memorization in Autoregressive Language Models},
author = {David Ilić and Kostadin Cvejoski and David Stanojević and Evgeny Grigorenko},
journal= {arXiv preprint arXiv:2604.03199},
year = {2026}
}
备注
Preprint. 10 pages, 4 figures, 12 tables