基于神经元激活的 LLM 预训练数据识别框架
人工智能
2025-07-23 v1
摘要
大型语言模型 (LLM) 的性能与其训练数据密切相关,训练数据可能包含受版权保护的内容或私人信息,引发法律和伦理争议。此外,LLM 也因数据污染和内化偏见而受到批评。为解决这些问题,提出了预训练数据检测 (PDD) 任务,以识别特定数据是否包含在 LLM 预训练语料库中。然而,现有 PDD 方法常依赖预测置信度和损失等表面特征,导致表现平淡。为提高性能,我们引入 NA-PDD,一种分析 LLM 中训练数据与非训练数据在神经元激活模式差异的新型算法。这是基于这些数据类型在 LLM 推理期间激活不同神经元的观察所致。我们还引入 CCNewsPDD,一个采用严格数据转换以确保训练数据和非训练数据时间分布一致的时序无偏基准。我们的实验表明,NA-PDD 在三个基准测试和多个 LLM 上均显著优于现有方法。
引用
@article{arxiv.2507.16414,
title = {Identifying Pre-training Data in LLMs: A Neuron Activation-Based Detection Framework},
author = {Hongyi Tang and Zhihao Zhu and Yi Yang},
journal= {arXiv preprint arXiv:2507.16414},
year = {2025}
}