NS-Net:基于NULL空间解耦CLIP语义信息的通用AI生成图像检测
计算机视觉与模式识别
2026-05-11 v4
摘要
生成模型(如GAN和扩散模型)的快速发展促进了高度逼真图像的创建,引发对其在安全敏感领域滥用的担忧。虽然现有检测器在已知生成 setting 下表现良好,但在未知生成模型上常常失效,尤其当真实图像与假图像的语义内容高度一致时。本文重新审视CLIP特征用于AI生成图像检测的做法,发现CLIP视觉特征中嵌入的高层语义信息限制了有效判别能力。为此,我们提出NS-Net——一种新型检测框架,利用NULL空间投影解耦CLIP视觉特征中的语义信息,随后通过对比学习捕获真实图像与生成图像之间的内在分布差异。此外,我们设计了Patch Selection策略以缓解全局图像结构引起的语义偏差,保留细粒度痕迹。大规模实验在包含40种多样化生成模型生成的开放世界基准上表明,NS-Net相较于现有国际前沿方法在检测准确率上提升7.4%,显著提升了跨GAN和扩散模型生成技术的泛化能力。
引用
@article{arxiv.2508.01248,
title = {NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection},
author = {Jiazhen Yan and Fan Wang and Weiwei Jiang and Ziqiang Li and Zhangjie Fu},
journal= {arXiv preprint arXiv:2508.01248},
year = {2026}
}