Bi-LORA:一种用于合成图像检测的视觉-语言方法
计算机视觉与模式识别
2024-04-09 v2 密码学与安全
机器学习
摘要
深度图像合成技术(如生成对抗网络(GAN)和扩散模型(DM))的进步,开启了生成高度逼真图像的时代。尽管这一技术进步引起了广泛关注,但也引发了人们对难以区分真实图像与其合成对应物的担忧。本文受视觉与语言之间强大的融合能力以及视觉-语言模型(VLM)零样本特性的启发,提出了一种名为 Bi-LORA 的创新方法。该方法利用 VLM,并结合低秩自适应(LORA)微调技术,以提高对未见模型生成图像的合成图像检测精度。我们方法的核心概念转变在于将二分类问题重新转化为图像描述任务,利用前沿 VLM 的独特能力,特别是自举语言图像预训练(BLIP2)。我们进行了严格且全面的实验以验证所提方法的有效性,特别是在检测训练时未知的基于扩散的生成模型所生成的未见扩散图像方面,展现出对噪声的鲁棒性以及对 GAN 的泛化能力。所得结果显示,在未见生成模型上的合成图像检测平均准确率高达 93.41%。本研究相关的代码和模型可在 https://github.com/Mamadou-Keita/VLM-DETECT 公开获取。
引用
@article{arxiv.2404.01959,
title = {Bi-LORA: A Vision-Language Approach for Synthetic Image Detection},
author = {Mamadou Keita and Wassim Hamidouche and Hessen Bougueffa Eutamene and Abdenour Hadid and Abdelmalik Taleb-Ahmed},
journal= {arXiv preprint arXiv:2404.01959},
year = {2024}
}