CDI:扩散模型中的版权数据识别
摘要
扩散模型受益于用于训练的大型且多样化的数据集。由于这些数据通常是在未经数据所有者许可的情况下从互联网上抓取的,这引发了关于版权和知识产权保护的担忧。虽然当扩散模型在推理时完美重现训练样本时,数据的(非法)使用很容易被检测到,但当可疑扩散模型的输出与原始数据并不高度近似时,数据所有者很难验证其数据是否被用于训练。从概念上讲,成员推理攻击(MIAs)可以检测给定数据点是否在训练期间被使用,为应对这一挑战提供了合适的工具。然而,我们证明现有的 MIAs 不足以可靠地确定单个图像在大型、最先进的扩散模型中的成员归属。为了克服这一限制,我们提出了 CDI,这是一个供数据所有者识别其数据集是否被用于训练给定扩散模型的框架。CDI 依赖于数据集推理技术,即 CDI 不使用来自单个数据点的成员信号,而是利用这样一个事实:大多数数据所有者(如图库提供商、视觉媒体公司甚至个人艺术家)拥有的数据集包含多个公开暴露的数据点,这些数据点可能全部被包含在给定扩散模型的训练中。通过选择性地聚合来自现有 MIAs 的信号,并使用新的手工方法为这些数据集提取特征,将其输入评分模型并应用严格的统计检验,CDI 使得数据所有者仅需 70 个数据点,即可在超过 99% 的置信度下识别其数据是否被用于训练给定扩散模型。因此,CDI 为数据所有者主张其版权数据的非法使用提供了有价值的工具。我们在 https://github.com/sprintml/copyrighted_data_identification 公开了代码。
引用
@article{arxiv.2411.12858,
title = {CDI: Copyrighted Data Identification in Diffusion Models},
author = {Jan Dubiński and Antoni Kowalczuk and Franziska Boenisch and Adam Dziedzic},
journal= {arXiv preprint arXiv:2411.12858},
year = {2025}
}
备注
Accepted at CVPR2025 (Conference on Computer Vision and Pattern Recognition) Code available at https://github.com/sprintml/copyrighted_data_identification