中文

面向个性化文本到图像扩散模型的数据集版权规避攻击

计算机视觉与模式识别 2025-12-24 v2 人工智能 密码学与安全

摘要

文本到图像(T2I)扩散模型能够根据文本提示生成高质量图像。然而,为个性化目的微调这些预训练模型引发了对未经授权使用数据集的担忧。为解决此问题,最近提出了数据集所有权验证(DOV),通过后门技术将水印嵌入微调数据集。这些水印在良性样本上保持休眠,但在触发时产生所有者指定的输出。尽管前景广阔,DOV 对版权规避攻击(CEA)的鲁棒性仍未被探索。在本文中,我们研究了攻击者如何绕过这些机制,使在水印数据集上训练的模型能够规避所有权验证。我们首先分析了通过后门移除实现的潜在攻击的局限性,包括 TPD 和 T2IShield。在实践中,TPD 因随机性导致效果不一致,而当水印以局部图像块形式嵌入时,T2IShield 会失效。为此,我们提出了 CEAT2I,这是首个专门针对 T2I 扩散模型中 DOV 的 CEA。CEAT2I 包含三个阶段:(1)受 T2I 模型在水印样本上相对于中间特征而非训练损失收敛更快的观察启发,我们可靠地检测水印样本;(2)我们迭代地从检测到的样本的提示中消融词元,并监控特征偏移以识别触发词元;(3)我们应用闭式概念擦除方法移除注入的水印。大量实验表明,CEAT2I 能有效规避最先进的 DOV 机制,同时保持模型性能。代码可在 https://github.com/csyufei/CEAT2I 获取。

关键词

引用

@article{arxiv.2505.02824,
  title  = {Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models},
  author = {Kuofeng Gao and Yufei Zhu and Yiming Li and Jiawang Bai and Yong Yang and Zhifeng Li and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2505.02824},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Information Forensics and Security