FIDAVL:使用视觉语言模型的虚假图像检测与归因
计算机视觉与模式识别
2024-09-06 v1 密码学与安全
摘要
我们提出了 FIDAVL:使用视觉语言模型的虚假图像检测与归因。FIDAVL 是一种新颖且高效的多任务方法,其灵感来源于视觉与语言处理之间的协同作用。利用零样本学习的优势,FIDAVL 借助视觉与语言之间的互补性以及软提示微调策略,来检测虚假图像并将其准确归因至其原始源模型。我们在一个包含由各种 SOTA 模型生成的合成图像的综合数据集上进行了广泛实验。结果表明,FIDAVL 取得了 95.42% 的平均检测准确率和 95.47% 的 F1 分数,同时获得了显著的性能指标,在将合成图像归因至其各自源生成模型时,平均 F1 分数为 92.64%,ROUGE-L 分数为 96.50%。本工作的源代码将公开发布于 https://github.com/Mamadou-Keita/FIDAVL。
引用
@article{arxiv.2409.03109,
title = {FIDAVL: Fake Image Detection and Attribution using Vision-Language Model},
author = {Mamadou Keita and Wassim Hamidouche and Hessen Bougueffa Eutamene and Abdelmalik Taleb-Ahmed and Abdenour Hadid},
journal= {arXiv preprint arXiv:2409.03109},
year = {2024}
}