ViGText:集成视觉-语言模型解释与图神经网络的深度伪造图像检测
计算机视觉与模式识别
2026-02-23 v2 人工智能
机器学习
摘要
深度伪造技术的迅猛崛起产生了逼真但欺诈性的数字内容,威胁了媒体的真实性。传统的深度伪造检测方法在面对高度 sophisticated 的定制化深度伪造图像时,尤其在泛化性和对恶意攻击的鲁棒性方面常常不堪一击。本文引入 ViGText,一种将图像与 Vision Large Language Model(VLLM)文本解释集成到图基框架中的新方法,以提高深度伪造检测效果。ViGText 的新颖之处在于其将详细解释与视觉数据相结合,提供了比字幕更具上下文感知性的分析,后者常常缺乏具体性,难以揭示细微的不一致性。ViGText 系统地将图像划分为多个小块,构建图像和文本图,并通过图神经网络(GNN)进行整合以识别深度伪造图像。通过在空间和频率域中进行多级特征提取,ViGText 捕获了细节,显著增强了其对复杂深度伪造图像的鲁棒性和检测准确性。广泛的实验表明,ViGText 在泛化性方面显著提升,能够对用户定制化的深度伪造图像实现显著的性能提升。具体而言,在泛化评估中,平均 F1 分数从 72.45% 提升至 98.32%,反映出该模型对稳定扩散模型中未见且精细调优变体的泛化能力。就鲁棒性而言,ViGText 的召回率比其他深度伪造检测方法提高了 11.1%。面对利用其图基架构进行的针对性攻击时,ViGText 将分类性能降幅限制在小于 4% 之内。ViGText 使用详细的视觉和文本分析,树立了检测深度伪造图像的新标准,有助于确保媒体的真实性和信息的完整性。
引用
@article{arxiv.2507.18031,
title = {ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks},
author = {Ahmad ALBarqawi and Mahmoud Nazzal and Issa Khalil and Abdallah Khreishah and NhatHai Phan},
journal= {arXiv preprint arXiv:2507.18031},
year = {2026}
}