解耦语义与指纹:用于 AI 生成图像检测的通用表示
计算机视觉与模式识别
2026-05-18 v2
摘要
检测来自未见过的生成架构的 AI 生成图像仍具有挑战性,因为现有模型常常过度拟合到生成器特定的指纹和语义内容,而非学习通用的伪造痕迹。我们将此失败归因于特征缠结:检测器将这些因素学习为单个缠结表示,其中通用的伪造痕迹被不可分割地混合了生成器特定的指纹与语义内容。关键的是,我们的谱分析揭示,这种缠结是可避免的:不同的生成器特定指纹(如 GAN 的条纹与扩散模型的斑点)占据互斥的频率子空间,作为独立的叠加共存。利用这种物理正交性,我们提出了正交分解和净化网络(ODP-Net)来结构性地解耦这些因素。具体而言,ODP-Net 采用 (1) 实例感知正交分解,将特征投射到互斥的子空间:通用伪造痕迹、生成器特定指纹和语义内容;(2) 基于扰动的净化,以实现语义不变性;(3) 流形对齐,以弥补领域差距。通过显式地将通用伪造痕迹从生成器特定指纹和语义内容中解耦,ODP-Net 在未见过的生成架构(如 Stable Diffusion 3)上实现了最先进的性能,验证了结构化解耦是实现泛化的关键。
引用
@article{arxiv.2605.07074,
title = {Decoupling Semantics and Fingerprints: A Universal Representation for AI-Generated Image Detection},
author = {Zhiyuan Wang and Yanxiang Chen and Pengcheng Zhao and Yunfeng Diao and Xin Liao},
journal= {arXiv preprint arXiv:2605.07074},
year = {2026}
}
备注
~10 pages (IEEEtran two-column), 6 figures, 6 tables, 1 algorithm