扰动你的数据:基于改写的训练数据水印
计算与语言
2026-03-25 v1 机器学习
摘要
训练数据检测对于执行版权和数据许可至关重要,因为大型语言模型是在从互联网抓取的大规模文本语料库上训练的。我们提出了SPECTRA,一种即使在水印数据占训练语料库不到0.001%时也能可靠检测训练数据的水印方法。SPECTRA通过使用大型语言模型改写文本并根据独立评分模型对每个改写的可能性赋予分数来工作。选择一个改写使其分数与原始文本紧密匹配,以避免引入任何分布偏移。为了测试嫌疑模型是否在水印数据上训练,我们将其标记概率与评分模型的概率进行比较。我们证明SPECTRA在检测训练用数据与未训练用数据时实现了持续超过九个数量级的p值差距,大于所有基线方法。SPECTRA为数据所有者提供了一个可扩展的、发布前部署的水印,即使在大规模大型语言模型训练中也能存活。
引用
@article{arxiv.2512.17075,
title = {Perturb Your Data: Paraphrase-Guided Training Data Watermarking},
author = {Pranav Shetty and Mirazul Haque and Petr Babkin and Zhiqiang Ma and Xiaomo Liu and Manuela Veloso},
journal= {arXiv preprint arXiv:2512.17075},
year = {2026}
}
备注
Accepted to AAAI 2026