中文

大语言模型数据集推断:你的模型是在我的数据集上训练的吗?

机器学习 2024-06-11 v1 计算与语言 密码学与安全

摘要

大语言模型(LLM)在现实世界中的普及伴随着针对公司的版权案件增加,这些公司因使用来自互联网的未经许可数据训练其模型而被起诉。最近的工作提出了识别单个文本序列是否为模型训练数据成员的方法,即成员推断攻击(MIA)。我们证明,这些MIA表面上的成功是由于选择了与成员(例如,用于训练模型的时间上更近的维基百科文章)属于不同分布的非成员(未用于训练的文本序列)(例如,时间上偏移的近期维基百科文章)。这种分布偏移使得成员推断看似成功。然而,当区分来自同一分布(例如,在本例中为同一时间段)的成员和非成员时,大多数MIA方法的表现并不比随机猜测好。即使MIA有效,我们发现不同的MIA在推断来自不同分布的样本的成员身份时成功。相反,我们提出了一种新的数据集推断方法,以准确识别用于训练大语言模型的数据集。这种范式现实地存在于当今的版权环境中,即作者声称LLM是在他们撰写的多个文档(例如一本书)上训练的,而不是某一个特定的段落。虽然数据集推断与成员推断面临许多相同的挑战,但我们通过选择性地组合为给定分布提供正信号的MIA,并聚合它们以对给定数据集执行统计检验来解决这个问题。我们的方法成功地区分了Pile不同子集的训练集和测试集,具有统计上显著的p值<0.1,且没有误报。

关键词

引用

@article{arxiv.2406.06443,
  title  = {LLM Dataset Inference: Did you train on my dataset?},
  author = {Pratyush Maini and Hengrui Jia and Nicolas Papernot and Adam Dziedzic},
  journal= {arXiv preprint arXiv:2406.06443},
  year   = {2024}
}

备注

Code is available at \href{https://github.com/pratyushmaini/llm_dataset_inference/