视觉 Mamba 能否提升 AI 生成图像检测?一项深入探究
计算机视觉与模式识别
2026-05-27 v2 密码学与安全
社会与信息网络
摘要
近年来,计算机视觉取得了显著进展,这得益于卷积神经网络 (CNNs)、生成对抗网络 (GANs)、基于扩散的架构、视觉 Transformer (ViTs) 以及最近的视觉-语言模型 (VLMs) 等创新架构的发展。不可否认,这些进展有助于创建日益逼真和多样化的视觉内容。然而,图像生成领域的这些进步也引发了人们对潜在滥用的担忧,例如虚假信息、身份盗窃以及对隐私和安全的威胁。与此同时,在这个快速发展的领域中,基于 Mamba 的架构已成为一系列图像分析任务的多功能工具,包括分类、分割、医学成像、目标检测和图像恢复。然而,与现有技术相比,其在识别 AI 生成图像方面的潜力仍相对未被探索。本研究对用于 AI 生成图像检测的 Vision Mamba 模型进行了系统评估和比较分析。我们在多样化的数据集和合成图像源上,将多种 Vision Mamba 变体与具有代表性的 CNNs、ViTs 和基于 VLM 的检测器进行了基准测试,重点关注准确性、效率以及在不同图像类型和生成模型上的泛化能力等关键指标。通过这项全面分析,我们旨在阐明 Vision Mamba 在检测 AI 生成图像的适用性、准确性和效率方面相对于现有方法的优势与局限。总体而言,我们的发现突显了 Vision Mamba 作为旨在区分真实与 AI 生成视觉内容的系统组件的前景及当前局限。在区分真实与 AI 生成内容成为重大挑战的时代,这项研究对于提升检测能力至关重要。
引用
@article{arxiv.2605.14799,
title = {Can Visual Mamba Improve AI-Generated Image Detection? An In-Depth Investigation},
author = {Mamadou Keita and Wassim Hamidouche and Hessen Bougueffa Eutamene and Abdelmalik Taleb-Ahmed and Xianxun Zhu and Abdenour Hadid},
journal= {arXiv preprint arXiv:2605.14799},
year = {2026}
}