中文

理解和改进基于视觉基础模型的训练-free AI 生成图像检测

计算机视觉与模式识别 2024-12-02 v1

摘要

生成模型的快速发展带来了严重的风险,包括面部合成和编辑的深度伪造技术。传统方法依赖于训练分类器并通过 various feature extraction 技术增强通用性。与此同时,训练-free 检测方法通过直接利用视觉基础模型的统计属性来区分真实与假图像,从而解决数据有限和过拟合的问题。当前领先的训练-free 方法 RIGID 利用 DINOv2 对图像空间扰动的敏感性来检测假图像,发现假图像嵌入的敏感性高于真实图像。这一观察促使我们研究检测性能在不同模型 backbone、扰动类型和数据集之间的变化。我们的实验表明,检测性能与模型鲁棒性密切相关,自监督 (SSL) 模型提供了更可靠的表示。虽然高斯噪声有效检测通用对象,但在面部图像上表现较差,而高斯模糊更有效,可能源于频率 artifacts。为进一步提升检测性能,我们引入 Contrastive Blur 以提高面部图像的检测性能,并提出 MINDER (MINimum distance DetEctoR) 以解决噪声类型偏差,实现跨域性能平衡。除了性能提升外,我们的工作为生成和检测社区提供了宝贵的见解,深化了对用于深度伪造检测的模型鲁棒性属性的理解。

关键词

引用

@article{arxiv.2411.19117,
  title  = {Understanding and Improving Training-Free AI-Generated Image Detections with Vision Foundation Models},
  author = {Chung-Ting Tsai and Ching-Yun Ko and I-Hsin Chung and Yu-Chiang Frank Wang and Pin-Yu Chen},
  journal= {arXiv preprint arXiv:2411.19117},
  year   = {2024}
}