基于 Faster-Than-Lies 和视觉语言模型的 AI 生成图像可解释检测与图像局部化
计算机视觉与模式识别
2025-10-29 v1 人工智能
图像与视频处理
摘要
AI 生成图像的日益逼真正在挑战视觉真实性验证的难度。我们提出了一种可解释的图像真实性检测系统,将轻量级卷积分类器("Faster-Than-Lies")与视觉语言模型(Qwen2-VL-7B)结合,对 32x32 图像进行分类、局部化和解释检测到的人工生成痕迹。本模型在增强了对抗性扰动的扩展 CiFAKE 数据集上达到 96.5% 的准确率,并在 8 核 CPU 上保持 175 毫秒的推理时间,能够在本地或边缘设备上部署。利用基于自编码器的重建误差图生成图像局部化热图,这增强了对人类和视觉语言模型的可解释性。我们进一步将 70 种视觉痕迹类型归类为八个语义组,并为每个检测到的异常生成可解释的文本说明。本工作凸显了在低分辨率图像中结合视觉与语言推理以实现可解释真实性检测的可行性,并概述了在法医学、工业检验和社交媒体监控等跨领域的潜在应用。
引用
@article{arxiv.2510.23775,
title = {Explainable Detection of AI-Generated Images with Artifact Localization Using Faster-Than-Lies and Vision-Language Models for Edge Devices},
author = {Aryan Mathur and Asaduddin Ahmed and Pushti Amit Vasoya and Simeon Kandan Sonar and Yasir Z and Madesh Kuppusamy},
journal= {arXiv preprint arXiv:2510.23775},
year = {2025}
}