中文

大型语言模型中的版权检测:面向生成式 AI 开发的伦理方法

人工智能 2026-03-20 v1

摘要

大型语言模型(LLM)的广泛使用引发了关于训练数据中未经授权包含受版权保护内容的严重关切。现有检测框架如 DE-COP 计算密集,且 largely 不可及于独立创作者。随着法律审查加剧,迫切需要一种可扩展、透明且用户友好的解决方案。本文引入一个开源版权检测平台,使内容创作者能够验证其作品是否被用于LLM训练数据集。我们的方法通过提升现有方法,实现易用性、改进相似度检测、优化数据集验证,并通过高效 API 调用将计算开销降低10-30%。该框架具有直观的用户界面和可扩展后端,有助于提高 AI 开发中的透明度和伦理合规,为负责任的 AI 开发和版权执法奠定基础。

关键词

引用

@article{arxiv.2511.20623,
  title  = {Copyright Detection in Large Language Models: An Ethical Approach to Generative AI Development},
  author = {David Szczecina and Senan Gaffori and Edmond Li},
  journal= {arXiv preprint arXiv:2511.20623},
  year   = {2026}
}

备注

4 pages, 3 figures