中文

面向文本引导的图像到图像扩散模型的数据源识别

计算机视觉与模式识别 2025-05-20 v2

摘要

文本引导的图像到图像扩散模型在基于文本提示转换图像方面表现突出,允许进行精确而富有创造性的视觉修改。然而,这种强大的技术可能被用于传播虚假信息、侵犯版权以及规避内容追踪。这促使我们提出数据源识别(ID2^2)任务,用于文本引导的图像到图像扩散模型,旨在检索给定翻译查询的原始图像。ID2^2 的一个直观解决方案是训练一个专门的深度嵌入模型,从查询图像和参考图像中提取并比较特征。然而,由于不同扩散模型生成样本之间的视觉差异,这种基于相似度的方法在单一模型上的训练图像测试于另一个模型时会失败,限制了其在实际应用中的有效性。为解决此 ID2^2 任务的这一挑战,我们贡献了第一个数据集和一个在理论上得到保证的方法,两者都强调可泛化性。精选的数据集OriPID包含丰富的原始图像和引导提示,可用于训练和测试各种扩散模型中的潜在识别模型。在方法部分,我们首先证明存在一个线性变换可以最小化预训练变分自编码器(VAE)嵌入的生成样本与其原始图像之间的距离。随后,证明了这种简单的线性变换可在不同扩散模型之间普遍化。实验结果表明,所提出的方法在实现令人满意的泛化性能方面取得显著优势,相较于基于相似度的方法(提升 31.6%31.6\% mAP),甚至相较于具有泛化设计的方法。项目已公开 https://id2icml.github.io。

关键词

引用

@article{arxiv.2501.02376,
  title  = {Origin Identification for Text-Guided Image-to-Image Diffusion Models},
  author = {Wenhao Wang and Yifan Sun and Zongxin Yang and Zhentao Tan and Zhengdong Hu and Yi Yang},
  journal= {arXiv preprint arXiv:2501.02376},
  year   = {2025}
}

备注

Accepted by ICML 2025