中文

通过部分信息探测测量大型语言模型的版权风险

计算与语言 2024-09-24 v1 人工智能 密码学与安全

摘要

探讨大型语言模型(LLM)训练数据来源是调查这些模型潜在版权侵权问题中的关键方向。虽然这种方法可以识别训练数据中可能包含受版权保护材料的证据,但并不能直接测量侵权风险。近期研究转向测试LLM是否能够直接输出受版权保护的内容。针对这一方向,本文调查和评估了LLM生成侵权内容的能力,通过提供受版权保护材料的部分信息来实现,并尝试通过迭代提示使LLM生成更多侵权内容。具体而言,我们将受版权保护文本的一部分输入到LLM中,要求其续写,然后分析生成内容与原始受版权保护材料之间的重叠情况。我们的发现表明,LLM确实能够基于这些部分输入生成与受版权保护材料高度重叠的内容。

关键词

引用

@article{arxiv.2409.13831,
  title  = {Measuring Copyright Risks of Large Language Model via Partial Information Probing},
  author = {Weijie Zhao and Huajie Shao and Zhaozhuo Xu and Suzhen Duan and Denghui Zhang},
  journal= {arXiv preprint arXiv:2409.13831},
  year   = {2024}
}

备注

8 pages, 8 figures