不留痕迹:基于水印的大语言模型中版权数据集使用的黑箱检测
计算与语言
2025-10-06 v1
摘要
大语言模型(LLM)越来越多地在较小、领域特定的数据集上进行微调,以改善下游性能。这些数据集通常包含专有或受版权保护的材料,需要可靠的保障措施以防止未经授权的使用。现有的成员推理攻击(MIA)和数据集推理方法通常需要访问logits等内部信号,而当前的黑箱方法通常依赖手工设计的提示或用于校准的干净参考数据集,两者都限制了实际适用性。水印技术是一种有前景的替代方案,但先前技术可能降低文本质量或削弱任务性能。我们提出了TRACE,一个用于完全黑箱检测LLM微调中版权数据集使用的实用框架。TRACE通过私有密钥引导的无失真水印重写数据集,确保文本质量和下游效用。在检测阶段,我们利用微调对水印数据的放射性效应,并引入熵门控程序选择性地对高不确定性token评分,从而显著增强检测能力。在各种数据集和模型族上,TRACE持续实现了显著的检测结果(p<0.05),通常具有极强的统计证据。此外,它支持多数据集归因,并且在继续在大型非水印语料库上预训练后仍然保持鲁棒性。这些结果确立了TRACE作为可靠黑箱验证版权数据集使用的实用途径。我们将在以下地址发布代码:https://github.com/NusIoraPrivacy/TRACE。
引用
@article{arxiv.2510.02962,
title = {Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking},
author = {Jingqi Zhang and Ruibo Chen and Yingqing Yang and Peihua Mai and Heng Huang and Yan Pang},
journal= {arXiv preprint arXiv:2510.02962},
year = {2025}
}