通过秩相关性检测 LLM 训练数据中的非成员
计算与语言
2026-03-30 v1
摘要
随着大语言模型 (LLM) 在日益庞大且不透明的文本语料库上进行训练,确定哪些数据参与了训练已变得至关重要,这对于版权执法、合规审计和用户信任至关重要。虽然先前的工作侧重于检测数据集是否用于训练 (成员推断),但补充问题——验证数据集是否未用于训练——几乎未受到关注。我们通过引入 PRISM,一种仅使用模型 logits 的灰盒访问即可检测数据集层面非成员的方法来弥补这一差距。我们的关键洞察是:两个未见过同一数据集的模型在其归一化标记对数概率上的秩相关性高于一个模型在该数据上进行训练的情况。基于此观察,我们构建了一个基于相关性的检测器,以检测非成员。经验上,PRISM 在所有测试的数据集上可靠地排除了训练数据的成员身份,同时避免了误报,从而为验证特定数据集未被包含在 LLM 训练中提供了一个框架。
引用
@article{arxiv.2603.22707,
title = {Detecting Non-Membership in LLM Training Data via Rank Correlations},
author = {Pranav Shetty and Mirazul Haque and Zhiqiang Ma and Xiaomo Liu},
journal= {arXiv preprint arXiv:2603.22707},
year = {2026}
}
备注
Accepted to EACL 2026 Main Conference