中文

在下游任务中对LLM生成数据集进行水印处理

密码学与安全 2025-06-17 v1

摘要

大型语言模型(LLM)经历了快速发展,应用涵盖广泛领域,包括情感分类、评论生成和问答。由于其高效性和通用性,研究人员和公司越来越多地使用LLM生成的数据来训练模型。然而,无法追踪LLM生成的内容构成了一个重大挑战,可能导致LLM所有者的版权侵权。在本文中,我们提出了一种向LLM生成数据集中注入水印的方法,使下游任务能够被追踪,以检测这些数据集是否由原始LLM生成。这些下游任务可分为两类。第一类是在输入层使用生成数据集,常用于训练分类任务。另一类是输出层,模型训练者将LLM生成的内容用作下游任务(如问答任务)的输出。我们设计了一套全面的实验来评估两种水印方法。我们的结果表明我们的水印方法具有高度有效性。此外,关于模型效用,我们发现使用生成数据集训练的分类器在许多情况下测试准确率超过 0.900,表明此类模型的效用仍然稳健。对于输出层水印,我们观察到生成文本的质量与使用真实数据集产生的文本质量相当。通过我们的研究,我们旨在推进LLM版权保护,在这一领域保护知识产权方面迈出了重要一步。

关键词

引用

@article{arxiv.2506.13494,
  title  = {Watermarking LLM-Generated Datasets in Downstream Tasks},
  author = {Yugeng Liu and Tianshuo Cong and Michael Backes and Zheng Li and Yang Zhang},
  journal= {arXiv preprint arXiv:2506.13494},
  year   = {2025}
}