中文

检测大型语言模型中的数据污染

人工智能 2026-04-22 v1

摘要

大型语言模型(LLMs)在训练时利用大量数据,其中部分可能来自受版权保护的来源。成员推理攻击(MIA)旨在检测这些文档,并判断它们是否被包含在 LLMs 的训练语料库中。黑盒 MIA 需要大量的数据处理;因此,比较它们通常具有挑战性。我们在黑盒假设下研究了最先进的(SOTA)MIA,并使用统一的数据集集对它们进行相互比较,以确定其中是否有任何方法能够在 SOTA LLMs 下可靠地检测成员身份。此外,还开发了一种名为 Familiarity Ranking 的新方法,以展示黑盒 MIA 的一种可能途径,从而赋予 LLMs 更大的表达自由度,以更好地理解其推理过程。结果表明,没有任何方法能够可靠地检测 LLMs 中的成员身份,这在多个 LLMs 上所有方法的 AUC-ROC 均约为 0.5 中得到了体现。更先进的 LLMs 具有更高的 TPR 和 FPR,表明其具有更高的推理和泛化能力,这凸显了使用黑盒 MIA 检测 LLMs 成员身份的困难。

关键词

引用

@article{arxiv.2604.19561,
  title  = {Detecting Data Contamination in Large Language Models},
  author = {Juliusz Janicki and Savvas Chamezopoulos and Evangelos Kanoulas and Georgios Tsatsaronis},
  journal= {arXiv preprint arXiv:2604.19561},
  year   = {2026}
}