训练数据溯源验证:你的模型是否使用了我的生成模型生成的合成数据进行训练?
计算机视觉与模式识别
2025-03-13 v1
摘要
高质量的开源文本到图像模型大幅降低了获取逼真图像的门槛,但也面临潜在的滥用风险。具体而言,嫌疑人可能会在未经许可的情况下,使用这些生成模型生成的合成数据来训练特定任务的模型,尤其是在缺乏真实数据资源时。保护这些生成模型对其所有者的利益至关重要。在这项工作中,我们针对这一重要且未解决的问题提出了首个方法,称为训练数据溯源验证。TrainProVe 的基本原理基于泛化误差界原则,该原则表明,对于具有相同任务的两个模型,如果它们训练数据分布之间的距离较小,它们的泛化能力将更接近。我们在四个文本到图像模型(Stable Diffusion v1.4、latent consistency model、PixArt- 和 Stable Cascade)上验证了 TrainProVe 的有效性。结果表明,TrainProVe 在确定可疑模型训练数据的来源方面实现了超过 99\% 的验证准确率,超越了以往所有方法。代码可在 https://github.com/xieyc99/TrainProVe 获取。
引用
@article{arxiv.2503.09122,
title = {Training Data Provenance Verification: Did Your Model Use Synthetic Data from My Generative Model for Training?},
author = {Yuechen Xie and Jie Song and Huiqiong Wang and Mingli Song},
journal= {arXiv preprint arXiv:2503.09122},
year = {2025}
}
备注
Accepted by CVPR 2025