Digger:检测大语言模型训练中版权内容的误用
密码学与安全
2024-01-02 v1 计算与语言
机器学习
摘要
利用广泛且多样化数据集的预训练,是大语言模型(LLM)在众多应用中取得成功的关键因素。然而,这些数据集的详细构成往往未予公开,引发了人们对数据安全和潜在误用的担忧。当仍受法律保护的版权材料被有意或无意地不当使用时,这一点尤为相关,因为这侵犯了作者的权利。在本文中,我们引入了一个详细的框架,旨在检测和评估 LLM 训练数据集中是否存在潜在受版权保护书籍的内容。该框架还为每个内容样本被包含的可能性提供了置信度估计。为了验证我们的方法,我们进行了一系列模拟实验,结果证实了该框架在识别和处理 LLM 训练过程中内容误用实例的有效性。此外,我们调查了这些数据集中是否存在来自著名文学作品的可识别引语。我们的研究结果对确保 LLM 开发中版权材料的合规使用具有重要意义,突显了该领域对更透明和负责任的数据管理实践的需求。
引用
@article{arxiv.2401.00676,
title = {Digger: Detecting Copyright Content Mis-usage in Large Language Model Training},
author = {Haodong Li and Gelei Deng and Yi Liu and Kailong Wang and Yuekang Li and Tianwei Zhang and Yang Liu and Guoai Xu and Guosheng Xu and Haoyu Wang},
journal= {arXiv preprint arXiv:2401.00676},
year = {2024}
}