DE-COP:检测语言模型训练数据中的版权内容
计算与语言
2024-06-26 v2 机器学习
摘要
考虑到训练数据通常不公开,我们如何检测语言模型的训练过程中是否使用了版权内容?我们的动机基于这样一个前提:语言模型很可能识别出其训练文本中的逐字摘录。我们提出了 DE-COP,一种确定某段版权内容是否被纳入训练的方法。DE-COP 的核心方法是用多项选择题探测大型语言模型(LLM),选项包括逐字文本及其改写版本。我们构建了 BookTection 基准,包含 165 本在模型训练截止日期之前和之后出版的书籍摘录及其改写版本。实验表明,在具有 logits 可用性的模型上,DE-COP 的检测性能(AUC)比先前最佳方法高出 9.6%。此外,DE-COP 在完全黑盒模型上检测可疑书籍的平均准确率达到 72%,而先前方法的准确率约为 4%。代码和数据集可在 https://github.com/LeiLiLab/DE-COP 获取。
引用
@article{arxiv.2402.09910,
title = {DE-COP: Detecting Copyrighted Content in Language Models Training Data},
author = {André V. Duarte and Xuandong Zhao and Arlindo L. Oliveira and Lei Li},
journal= {arXiv preprint arXiv:2402.09910},
year = {2024}
}