利用层次化图像文本错位进行通用假图像检测
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
随着生成模型的快速发展,检测生成的假图像以防止其恶意用途已成为近期的关键问题。现有方法将这一挑战视为简单的二元图像分类任务。然而,这些方法仅关注视觉线索,导致训练出的检测器对特定图像模式过拟合,无法泛化到未见的模型。本文从多模态视角出发,发现假图像无法与相应描述符的图像正确对齐,而真实图像可以。基于此观察,我们提出一种简单而有效的检测器,称为ITEM,通过在联合视觉语言空间中利用图像文本错位作为判别线索。具体而言,我们首先测量图像和描述符在预训练CLIP空间中的错位,然后调谋一个MLP头执行常规检测任务。进一步,我们提出一种层次化错位方案,首先关注整个图像,然后关注描述符中描述的每个语义对象,从而可以探索全局和细粒度局部语义错位作为线索。大量实验表明,我们的方法在各种最新生成模型上均优于其他最先进方法,具有卓越的泛化性和鲁棒性。
引用
@article{arxiv.2511.00427,
title = {Leveraging Hierarchical Image-Text Misalignment for Universal Fake Image Detection},
author = {Daichi Zhang and Tong Zhang and Jianmin Bao and Shiming Ge and Sabine Süsstrunk},
journal= {arXiv preprint arXiv:2511.00427},
year = {2025}
}