当语义起调节作用:重新思考块打乱与内部偏差以实现基于 CLIP 的生成图像检测
计算机视觉与模式识别
2025-11-25 v1
摘要
GAN 和扩散模型的快速进展为检测 AI 生成图像带来了新挑战。尽管基于 CLIP 的检测器展现出有前景的泛化能力,但它们往往依赖语义线索而非生成器伪影,导致在分布偏移下性能脆弱。在本工作中,我们重新审视语义偏差的本质,并发现块打乱对 CLIP 提供了异常显著的好处,它破坏了全局语义连续性同时保留了局部伪影线索,从而降低了语义熵并在自然图像与合成图像之间均化了特征分布。通过详细的逐层分析,我们进一步表明 CLIP 的深层语义结构充当调节器,在语义偏差被抑制后稳定跨域表示。在上述发现的指导下,我们提出了 SemAnti,一种语义对抗微调范式,它冻结语义子空间并仅对打乱语义下敏感的层进行适配。尽管其设计简单,SemAnti 在 AIGCDetectBenchmark 和 GenImage 上实现了最先进的跨域泛化性能,证明了调节语义是释放 CLIP 在鲁棒 AI 生成图像检测中全部潜力的关键。
引用
@article{arxiv.2511.19126,
title = {When Semantics Regulate: Rethinking Patch Shuffle and Internal Bias for Generated Image Detection with CLIP},
author = {Beilin Chu and Weike You and Mengtao Li and Tingting Zheng and Kehan Zhao and Xuan Xu and Zhigao Lu and Jia Song and Moxuan Xu and Linna Zhou},
journal= {arXiv preprint arXiv:2511.19126},
year = {2025}
}
备注
14 pages, 7 figures and 7 tables