中文

在大语言模型训练中使用唯一标识符保护版权材料

计算与语言 2025-07-17 v3 密码学与安全 信息检索 机器学习

摘要

训练大型语言模型(LLM)的一个主要担忧是它们是否滥用了受版权保护的在线文本。随着训练数据规模的增加以及LLM在日常生活中的普及,出现了两个问题:1)由相似示例误导的假阳性成员推断结果;2)成员推断方法通常过于复杂,终端用户难以理解和使用。为了解决这些问题,我们提出了一种替代的“插入-检测”方法,倡导网络用户和内容平台使用唯一标识符进行可靠且独立的成员推断。用户和平台可以创建自己的标识符,将其嵌入受版权保护的文本中,并在未来的LLM中独立检测它们。作为初步演示,我们引入了鬼影句子和用户友好的最后k词测试,允许终端用户与LLM聊天进行成员推断。鬼影句子主要由随机自然词的唯一口令组成,可以附带自定义元素以绕过可能的过滤规则。最后k词测试需要鬼影句子有显著的重复次数(≥10)。对于重复次数较少的情况,我们设计了一个额外的困惑度测试,因为LLM在遇到不自然的口令时会表现出高困惑度。我们还对鬼影句子的记忆和成员推断进行了全面研究,考察了训练数据规模、模型大小、重复次数、插入位置、口令词表、对齐等因素。我们的研究表明了在真实场景中应用鬼影句子的可能性,并为潜在应用提供了指导。

关键词

引用

@article{arxiv.2403.15740,
  title  = {Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training},
  author = {Shuai Zhao and Linchao Zhu and Ruijie Quan and Yi Yang},
  journal= {arXiv preprint arXiv:2403.15740},
  year   = {2025}
}

备注

A technical report, work mainly done in the early of 2024