中文

DINOv3 超越专用检测器:图像鉴forensics 的简单基线模型

计算机视觉与模式识别 2026-04-20 v1

摘要

随着深度生成模型的快速发展,真实的假图像变得越来越容易获取,但现有的局化方法依赖于复杂的设计,仍然难以在不同的操纵类型和影像条件下获得良好泛化。我们提出一个简单而强大的基线模型,基于 DINOv3 配合 LoRA 适配和轻量级卷积解码器。在 CAT-Net 协议下,我们的最佳模型在四个标准基准测试上平均像素级 F1 分数提升了 17.0 分,仅使用 9.1M 参数即可在冻结 ViT-L 背bone上实现,而且即便是我们最小的变体也超越了所有以前的专用方法。LoRA 在所有背bone规模下都优于完整微调。在数据稀缺的 MVSS-Net 协议下,LoRA 达到了平均 F1 为 0.774,而最强的以前方法为 0.530;完整微调在不稳定,表明预训练的表征编码保留了比覆盖更好的 Forensic 信息。该基线模型对高斯噪声、JPEG 重压缩和高斯模糊具有强大的鲁棒性。我们希望本工作可以为研究社区提供可靠的基线,并为未来的图像鉴forensics 应用提供实用的起点。代码已公开于 https://github.com/Irennnne/DINOv3-IML。

关键词

引用

@article{arxiv.2604.16083,
  title  = {DINOv3 Beats Specialized Detectors: A Simple Foundation Model Baseline for Image Forensics},
  author = {Jieming Yu and Qiuxiao Feng and Zhuohan Wang and Xiaochen Ma},
  journal= {arXiv preprint arXiv:2604.16083},
  year   = {2026}
}

备注

Technical report