中文

从大语言模型中检测预训练数据

计算与语言 2024-03-12 v3 密码学与安全 机器学习

摘要

尽管大语言模型(LLMs)已被广泛部署,用于训练它们的数据却很少被披露。鉴于该数据规模惊人,高达数万亿 token,几乎可以肯定其包含了潜在有问题的文本,如受版权保护的材料、个人可识别信息,以及广泛报道的参考基准的测试数据。然而,我们目前无从知晓其中包含哪些此类数据以及比例如何。在本文中,我们研究预训练数据检测问题:给定一段文本以及对 LLM 的黑盒访问权限(不知晓预训练数据),我们能否确定该模型是否在所提供的文本上训练过?为推进此研究,我们引入了动态基准 WIKIMIA,其利用模型训练前后创建的数据来支持金标准检测。我们还提出了一种基于简单假设的新检测方法 Min-K% Prob:未见过的样本可能包含若干在 LLM 下概率极低的离群词,而见过的样本则不太可能含有此类低概率词。Min-K% Prob 可在无任何关于预训练语料的知识或额外训练的情况下应用,有别于先前需要在与预训练数据相似的数据上训练参考模型的检测方法。此外,我们的实验表明,Min-K% Prob 在 WIKIMIA 上比这些先前方法提升了 7.4%。我们将 Min-K% Prob 应用于三个真实场景:受版权保护书籍检测、受污染下游样本检测以及机器遗忘的隐私审计,发现它是一种始终有效的解决方案。

关键词

引用

@article{arxiv.2310.16789,
  title  = {Detecting Pretraining Data from Large Language Models},
  author = {Weijia Shi and Anirudh Ajith and Mengzhou Xia and Yangsibo Huang and Daogao Liu and Terra Blevins and Danqi Chen and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2310.16789},
  year   = {2024}
}