中文

免费实现对抗鲁棒的 AI 生成图像检测:信息论视角

计算机视觉与模式识别 2025-06-02 v2

摘要

人工智能生成图像(AIGI)的快速发展便利了其恶意使用,例如伪造和虚假信息。因此,人们提出了许多方法来检测伪造图像。尽管此类检测器已被证明普遍容易受到对抗攻击的威胁,但该领域的防御方法仍然稀缺。在本文中,我们首先发现被广泛认为是最有效防御方法的对抗训练(AT)在 AIGI 检测中会出现性能崩溃。通过信息论视角,我们进一步将崩溃原因归结为特征纠缠,这破坏了特征-标签互信息的保留。相反,标准检测器表现出清晰的特征分离。受此差异启发,我们提出了基于信息论测量的免训练鲁棒检测(TRIM),这是首个针对 AIGI 检测的免训练对抗防御方法。TRIM 构建于标准检测器之上,并利用预测熵和 KL 散度来量化特征偏移。在多个数据集和攻击上的大量实验验证了我们 TRIM 方法的优越性,例如,在 ProGAN(GenImage)上比 state-of-the-art 防御方法高出 33.88%(28.91%),同时良好地保持了原始准确率。

关键词

引用

@article{arxiv.2505.22604,
  title  = {Adversarially Robust AI-Generated Image Detection for Free: An Information Theoretic Perspective},
  author = {Ruixuan Zhang and He Wang and Zhengyu Zhao and Zhiqing Guo and Xun Yang and Yunfeng Diao and Meng Wang},
  journal= {arXiv preprint arXiv:2505.22604},
  year   = {2025}
}