中文

DeeCLIP:基于 CLIP-ViT 且具备鲁棒性与广泛性的人工智能生成图像检测框架

计算机视觉与模式识别 2025-04-29 v1 密码学与安全

摘要

本文介绍了 DeeCLIP,这是一个用于检测人工智能生成图像的新型框架,基于 CLIP-ViT 和融合学习。尽管生成模型在制造高度逼真图像方面取得了显著进展,但现有检测方法往往难以在不同模型之间普遍化,且对微小扰动极其敏感。为解决这些挑战,DeeCLIP 引入了 DeeFuser 模块,将高层特征和低层特征进行融合,从而提高了对压缩和模糊等退化的鲁棒性。此外,我们应用三角损失来细化嵌入空间,增强模型区分真实与合成内容的能力。为进一步实现轻量级适应且保留预训练知识,我们在 CLIP-ViT 主干网络中采用低秩适应(LoRA)进行参数高效微调。该方法支持在不牺牲泛化能力的情况下实现有效的零样本学习。DeeCLIP 仅在 4 类 ProGAN 数据上训练,即可在由生成对抗网络(GAN)和扩散模型组成的 19 个测试子集上实现 89.00% 的平均准确率。尽管参数更少,DeeCLIP 仍优于现有方法,显示出对各种生成模型和真实世界失真的优异鲁棒性。代码已公开于 https://github.com/Mamadou-Keita/DeeCLIP 供研究使用。

关键词

引用

@article{arxiv.2504.19876,
  title  = {DeeCLIP: A Robust and Generalizable Transformer-Based Framework for Detecting AI-Generated Images},
  author = {Mamadou Keita and Wassim Hamidouche and Hessen Bougueffa Eutamene and Abdelmalik Taleb-Ahmed and Abdenour Hadid},
  journal= {arXiv preprint arXiv:2504.19876},
  year   = {2025}
}