中文

CLIP 特征是否足以实现通用合成图像来源归因?

计算机视觉与模式识别 2025-06-03 v1

摘要

扩散模型在视觉合成方面的持续进步催生了许多新颖有趣的合成图像用例,同时也引发了滥用潜在带来的社会威胁。为此,需要检测并归因于其来源模型。鉴于新型生成器的频繁发布,现实应用需要考虑开放集情境,即某些模型在训练时未被看到。现有 Forensic 技术要么仅限于封闭集设置,要么仅适用于 GAN 生成的图像,依赖脆弱的基于频率的“指纹”特征。相反,我们提出了一个简单而有效的框架,利用大型预训练基础模型的特征,对由各种生成模型(包括扩散模型)产生的合成图像进行开放集来源归因。我们展示了该方法在 attribution 性能上显著优于现有方法,即使在数据有限的情境下也能更好地泛化到来自多样化架构的图像。我们将代码公开于:https://github.com/ciodar/UniversalAttribution。

关键词

引用

@article{arxiv.2408.09153,
  title  = {Are CLIP features all you need for Universal Synthetic Image Origin Attribution?},
  author = {Dario Cioni and Christos Tzelepis and Lorenzo Seidenari and Ioannis Patras},
  journal= {arXiv preprint arXiv:2408.09153},
  year   = {2025}
}

备注

Accepted at ECCV 2024 TWYN workshop