Defactify 4.0 上的 SKDU:运用数据增强的 Vision Transformer 用于 AI 生成图像检测
计算机视觉与模式识别
2025-03-25 v1
摘要
本工作旨在探索利用预训练视觉语言模型(如 Vision Transformer, ViT)结合先进数据增强策略,用于检测 AI 生成图像的潜力。我们的方案利用在 Defactify-4.0 数据集上进行微调的 ViT 模型,该数据集包括由最新模型生成的图像,如 Stable Diffusion 2.1、Stable Diffusion XL、Stable Diffusion 3、DALL-E 3 和 MidJourney。我们采用诸如翻转、旋转、高斯噪声注入和 JPEG 压缩等扰动技术,以提高模型的鲁棒性和泛化能力。实验结果表明,我们的 ViT 基于管道在验证和测试数据集上实现了最新性能,显著优于竞争方法。
引用
@article{arxiv.2503.18812,
title = {SKDU at De-Factify 4.0: Vision Transformer with Data Augmentation for AI-Generated Image Detection},
author = {Shrikant Malviya and Neelanjan Bhowmik and Stamos Katsigiannis},
journal= {arXiv preprint arXiv:2503.18812},
year = {2025}
}
备注
De-Factify 4.0 workshop at the 39th Annual AAAI Conference on Artificial Intelligence (AAAI 2025)