大语言模型的预训练数据检测:基于散度的校准方法
计算与语言
2025-05-22 v6 密码学与安全
摘要
随着大语言模型(LLM)训练语料规模的不断增大,模型开发者愈发不愿披露数据细节。这种缺乏透明度对科学评估和伦理部署构成挑战。近期,探索通过黑盒访问推断给定文本是否属于 LLM 训练数据的预训练数据检测方法。Min-K\% Prob 方法取得了最前沿成果,假设非训练实例往往包含少数异常词汇,其标记概率较低。然而,其有效性可能受限,因为其倾向于误分类那些包含大量具有高概率词汇的非训练文本。为此,我们引入一种基于散度的校准方法,灵感来自随机性概念。我们计算标记概率分布与标记频率分布之间的交叉熵(即散度),以导出检测得分。我们构建了一个中文语言基准测试集 PatentMIA,用于评估 LLM 在中文文本上的检测性能。在英语基准测试和 PatentMIA 上的实验结果表明,我们提出的方法在现有方法中显著优于其他方法。我们的代码和 PatentMIA 基准已公开于 https://github.com/zhang-wei-chao/DC-PDD。
引用
@article{arxiv.2409.14781,
title = {Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method},
author = {Weichao Zhang and Ruqing Zhang and Jiafeng Guo and Maarten de Rijke and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2409.14781},
year = {2025}
}
备注
Accepted by EMNLP 2024 main