从陌生到熟悉:通过大语言模型中梯度偏差检测预训练数据
计算与语言
2026-03-06 v1
摘要
预训练数据检测对于解决版权问题和缓解基准测试污染至关重要。现有方法主要关注基于似然性的统计特征或微调前后基于相似性的启发式信号,但前者易受语料中词频偏差的影响,后者则强烈依赖微调数据的相似性。从优化角度出发,我们观察到在训练过程中,样本以陌生转为熟悉的方式在梯度行为中呈现出系统性差异。熟悉样本表现出较小的更新幅度、在模型组件中不同的更新位置以及更锐利的神经元激活。基于此洞察,我们提出 GDS 方法,通过探测目标样本的梯度偏差得分(Gradient Deviation Scores, GDS)来识别预训练数据。具体而言,我们首先表示每个样本的梯度轮廓,捕捉跨全连接层(FFN)和注意力模块中参数更新的幅度、位置和集中程度,揭示成员数据与非成员数据之间的一致性差异。这些特征随后输入到轻量级分类器中进行二元成员推断。实验在五个公开数据集上表明,GDS 超越强大基准实现了最先进性能,显著提升了跨数据集的迁移性。进一步的可解释性分析显示梯度特征分布差异,为实际可扩展的预训练数据检测提供了可能。
引用
@article{arxiv.2603.04828,
title = {From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models},
author = {Ruiqi Zhang and Lingxiang Wang and Hainan Zhang and Zhiming Zheng and Yanyan Lan},
journal= {arXiv preprint arXiv:2603.04828},
year = {2026}
}