DinoLizer:用于生成式图像局部 inpainting 检测的 DINOv2 学习
计算机视觉与模式识别
2025-11-27 v1 人工智能
摘要
我们提出 DinoLizer,一种基于 DINOv2 的模型,用于局部分析生成式 inpainting。我们的 метод基于在 B-Free 数据集上预训练以检测合成图像的 DINOv2 模型。我们在 Vision Transformer 的 patch 嵌入上添加线性分类头,以 粒度预测操纵。该头部训练旨在聚焦语义被修改区域,将非语义编辑视为原始内容的一部分。由于 ViT 仅接受固定大小输入,我们使用滑动窗口策略聚合较大图像上的预测; resulting heatmaps 经过后处理以细化估计的二值操纵掩码。经验结果表明,DinoLizer 在来自不同生成模型的 inpainting 数据集上超越当前最好的局部分析检测器。它对常见后处理操作(如缩放、噪声添加和 JPEG 双重压缩)保持鲁健性。在平均情况下,DinoLizer 比下一名模型高出 12% 的交并比(IoU),在后处理后提升更为显著。我们的实验表明,离线 DINOv2 证明了 Vision Transformer 在此任务中的强大表征能力。最后,广泛的消融研究将 DINOv2 与其继任者 DINOv3 在 deepfake 局部分析中的比较确认了 DinoLizer 的优势。该代码将在论文接受后公开。
引用
@article{arxiv.2511.20722,
title = {DinoLizer: Learning from the Best for Generative Inpainting Localization},
author = {Minh Thong Doi and Jan Butora and Vincent Itier and Jérémie Boulanger and Patrick Bas},
journal= {arXiv preprint arXiv:2511.20722},
year = {2025}
}