AntifakePrompt:经提示微调的视觉-语言模型可作为伪造图像检测器
计算机视觉与模式识别
2024-08-22 v3
摘要
深度生成模型能够生成极为逼真的伪造图像,同时也引发了关于虚假信息与版权侵犯的担忧,即深度伪造威胁。深度伪造检测技术旨在区分真实与伪造图像,现有方法通常在图像域或各种特征域中学习分类器。然而,针对新兴且更先进的生成模型,深度伪造检测的泛化能力仍具挑战性。本文受视觉-语言模型(VLM)零样本优势启发,提出一种名为 AntifakePrompt 的新方法,利用 VLM(如 InstructBLIP)与提示微调技术提升对未知数据的深度伪造检测准确率。我们将深度伪造检测构建为视觉问答问题,并为 InstructBLIP 微调软提示以回答查询图像的真/伪信息。我们在来自 3 个内部保留与 20 个外部保留生成模型的多样化数据集上进行了全谱实验,涵盖现代文本到图像生成、图像编辑与对抗图像攻击。这些测试数据集为深度伪造检测领域的进一步研究提供了有用基准。此外,结果表明:(1)使用预训练视觉-语言模型配合提示微调,可显著且持续地提升深度伪造检测准确率(在未知域上的平均准确率从 71.06% 提升至 92.11%);(2)我们的优越性能以更少的训练数据与可训练参数为代价,构成了一种高效且经济的深度伪造检测方案。代码与模型见 https://github.com/nctu-eva-lab/AntifakePrompt。
引用
@article{arxiv.2310.17419,
title = {AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors},
author = {You-Ming Chang and Chen Yeh and Wei-Chen Chiu and Ning Yu},
journal= {arXiv preprint arXiv:2310.17419},
year = {2024}
}