中文

RAVID:检索增强视觉检测:面向 AI 生成图像识别的知识驱动方法

计算机视觉与模式识别 2025-08-07 v1 密码学与安全 信息检索

摘要

本文我们引入 RAVID,首个利用视觉检索增强生成 (RAG) 进行 AI 生成图像检测的框架。尽管 RAG 方法在缓解基础模型事实不准确方面显示出前景,但它们主要关注文本,视觉知识仍未得到充分探索。与此同时,现有检测方法在泛化性和鲁棒性方面常受限制,往往依赖低层次痕迹和模型特定特征,限制了其适应性。为此,RAVID 动态检索相关图像以增强检测。我们的方法使用微调的 CLIP 图像编码器,RAVID CLIP,增强了与类别相关提示的表示学习。我们进一步集成视觉-语言模型 (VLM) 来融合检索到的图像与查询图像,以丰富输入并提高准确性。给定查询图像后,RAVID 使用 RAVID CLIP 生成嵌入,从数据库中检索最相关的图像,并将其与查询图像组合,形成用于 VLM(如 Qwen-VL 或 Openflamingo)的增强输入。在覆盖 19 个生成模型的 UniversalFakeDetect 基准测试上,实验表明 RAVID 实现了平均 93.85% 的最佳性能。RAVID 在鲁棒性方面也优于传统方法,即使在高斯模糊和 JPEG 压缩等图像退化条件下,仍保持高准确率。具体而言,RAVID 在退化条件下的平均准确率为 80.27%,而最新的 SOTA 模型 C2P-CLIP 为 63.44%,在高斯模糊和 JPEG 压缩情景中均实现了持久的性能提升。代码将在接受后公开。

关键词

引用

@article{arxiv.2508.03967,
  title  = {RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification},
  author = {Mamadou Keita and Wassim Hamidouche and Hessen Bougueffa Eutamene and Abdelmalik Taleb-Ahmed and Abdenour Hadid},
  journal= {arXiv preprint arXiv:2508.03967},
  year   = {2025}
}