重新思考视觉Transformer在AI生成图像检测中的应用
计算机视觉与模式识别
2025-12-05 v1 机器学习
摘要
从CLIP-ViT中提取的丰富特征表示已被广泛用于AI生成图像检测。虽然大多数现有方法主要利用最后一层的特征,但我们系统地分析了逐层特征对该任务的贡献。我们的研究表明,早期层提供更局部化和更具泛化性的特征,在检测任务中往往超越最后一层特征的性能。此外,我们发现不同层捕捉数据的不同方面,每层对AI生成图像检测都有独特贡献。受这些发现启发,我们提出了一种新颖的自适应方法MoLD,通过基于门控的机制动态整合多个ViT层的特征。在GAN生成图像和扩散生成图像上的大量实验表明,MoLD显著提升了检测性能,增强了对不同生成模型的泛化能力,并在现实场景中表现出鲁棒性。最后,我们通过成功将其应用于其他预训练ViT(如DINOv2),展示了该方法的可扩展性和 versatility。
引用
@article{arxiv.2512.04969,
title = {Rethinking the Use of Vision Transformers for AI-Generated Image Detection},
author = {NaHyeon Park and Kunhee Kim and Junsuk Choe and Hyunjung Shim},
journal= {arXiv preprint arXiv:2512.04969},
year = {2025}
}
备注
Code: https://github.com/nahyeonkaty/mold