中文

利用大型视觉语言模型进行合成图像检测

计算机视觉与模式识别 2024-04-04 v1 密码学与安全 机器学习

摘要

近年来,能够从文本生成图像的模型的出现引起了广泛关注,提供了从文本描述创建逼真图像的可能性。然而,这些进展也引发了对这些图像潜在滥用的担忧,包括创建误导性内容,如假新闻和宣传。本研究调查了使用先进视觉语言模型(VLM)进行合成图像识别的有效性。具体来说,重点是调整最先进的图像描述模型用于合成图像检测。通过利用大型VLM的强大理解能力,目标是区分真实图像和由扩散模型生成的合成图像。本研究通过利用BLIP-2和ViTGPT2等视觉语言模型的能力,为合成图像检测的进步做出了贡献。通过定制图像描述模型,我们解决了与合成图像在现实世界应用中潜在滥用相关的挑战。本文描述的结果突出了VLM在合成图像检测领域的有前景的作用,优于传统的基于图像的检测技术。代码和模型可在https://github.com/Mamadou-Keita/VLM-DETECT获取。

关键词

引用

@article{arxiv.2404.02726,
  title  = {Harnessing the Power of Large Vision Language Models for Synthetic Image Detection},
  author = {Mamadou Keita and Wassim Hamidouche and Hassen Bougueffa and Abdenour Hadid and Abdelmalik Taleb-Ahmed},
  journal= {arXiv preprint arXiv:2404.02726},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2404.01959