面向 AI 生成图像检测的频域感知语义融合与门控注入
计算机视觉与模式识别
2026-05-01 v1
摘要
AI 生成的图像正变得越来越逼真和多样,给可泛化检测带来了重大挑战。虽然视觉基础模型(VFM)提供了丰富的语义表示,基于频率的方法捕获了互补的伪影线索,但结合这些模态的现有方法仍然存在泛化能力有限的问题,在未见过的生成模型上性能显著下降。我们将此限制归因于两个关键因素:对与特定生成器相关的易区分线索的频率捷径偏差,以及高层语义与低层频率模式之间的跨域表示冲突。为了解决这些问题,我们提出了一种频率感知门控注入网络(FGINet)以提高泛化能力。具体来说,我们设计了一个频带掩码频率编码器(BMFE),它在频域中应用跨频带掩码,以减少对生成器特定模式的依赖,并鼓励更多样化和可泛化的表示。我们进一步引入了一种逐层门控频率注入(LGFI)机制,通过自适应门控逐步将频率线索注入到 VFM 骨干网络中,与其层次化抽象对齐并缓解表示冲突。此外,我们提出了一个超球面紧致性学习(HCL)框架,该框架具有余弦间隔目标,以学习紧致且分离良好的表示。大量实验表明,FGINet 在多个具有挑战性的数据集上实现了最先进的性能和强大的泛化能力。
引用
@article{arxiv.2604.27875,
title = {Frequency-Aware Semantic Fusion with Gated Injection for AI-generated Image Detection},
author = {Shuchang Zhou and Shangkun Wu and Jiwei Wei and Ke Liu and Ran Ran and Caiyan Qin and Yang Yang},
journal= {arXiv preprint arXiv:2604.27875},
year = {2026}
}