中文

ISACL:面向版权训练数据泄露的内部状态分析器

计算与语言 2025-09-16 v2 机器学习

摘要

大型语言模型(LLM)彻底改变了自然语言处理(NLP),但也带来了无意中暴露版权或专有数据的风险,尤其是当此类数据用于训练但并不打算分发时。传统方法仅在内容生成后处理此类泄露,这可能导致敏感信息的暴露。本研究引入了一种主动方法:在文本生成之前检查 LLM 的内部状态以检测潜在泄露。通过使用精选的版权材料数据集,我们训练了一个神经网络分类器来识别风险,从而允许通过停止生成过程或更改输出以防止披露来进行早期干预。该框架与检索增强生成(RAG)系统集成,确保遵守版权和许可要求,同时增强数据隐私和伦理标准。我们的结果表明,分析内部状态可有效缓解版权数据泄露的风险,提供了一种可平滑融入 AI 工作流的可扩展解决方案,在确保遵守版权法规的同时保持高质量的文本生成。实现可在 GitHub 上获取。

关键词

引用

@article{arxiv.2508.17767,
  title  = {ISACL: Internal State Analyzer for Copyrighted Training Data Leakage},
  author = {Guangwei Zhang and Qisheng Su and Jiateng Liu and Cheng Qian and Yanzhou Pan and Yanjie Fu and Denghui Zhang},
  journal= {arXiv preprint arXiv:2508.17767},
  year   = {2025}
}