Inner-Probe:发现 LLM 架构中的版权相关数据生成
计算与语言
2026-01-05 v3
摘要
大语言模型 (LLM) 利用广泛的知识数据库并显示强大的文本生成能力。然而,它们对高质量受版权保护数据集的依赖引发了对生成文本中版权侵权的担忧。当前研究通常采用提示工程或语义分类器来识别受版权保护的内容,但这些方法存在两个显著局限性:(1) 识别哪个特定子数据集 (例如来自特定作者的作品) 影响 LLM 输出具有挑战性。(2) 将整个训练数据库视为受版权保护,从而忽略了非受版权保护训练数据的包含。我们提出了 Inner-Probe,一个轻量级框架,用于评估受版权子数据集对 LLM 生成文本的影响。与传统方法仅依赖文本不同,我们发现多头注意力 (MHA) 在 LLM 生成输出期间的结果提供了更有效的信息。因此,Inner-Probe 使用在 MHA 结果上进行监督式训练的轻量级 LSTM 网络进行子数据集贡献分析。凭借这种先验,Inner-Probe 通过一个在无监督对比学习中训练的拼接全局投影器,实现非受版权文本的检测。Inner-Probe 在 Books3 上的子数据集贡献分析中比语义模型训练高效 3 倍,在 Pile 数据集上在非受版权文本检测方面准确率提高 15.04% - 58.7%,在非受版权数据过滤方面 AUC 提升 0.104。
引用
@article{arxiv.2410.04454,
title = {Inner-Probe: Discovering Copyright-related Data Generation in LLM Architecture},
author = {Qichao Ma and Rui-Jie Zhu and Peiye Liu and Renye Yan and Fahong Zhang and Ling Liang and Meng Li and Zhaofei Yu and Zongwei Wang and Yimao Cai and Tiejun Huang},
journal= {arXiv preprint arXiv:2410.04454},
year = {2026}
}
备注
Accepted by IEEE Transactions on Artificial Intelligence