中文

IML-ViT:基于视觉变换器的图像篡改定位基准评测

计算机视觉与模式识别 2024-11-27 v4

摘要

先进的图像篡改技术日益挑战多媒体的可信度,催生了图像篡改定位(IML)的发展。但什么样的模型才算好的 IML 模型?答案在于捕捉伪影的方式。利用伪影要求模型提取篡改区域与真实区域之间的非语义差异,需要对两者进行显式比较。凭借自注意力机制,Transformer 天然应是捕捉伪影的更好候选。然而,由于数据集有限,目前尚无基于纯 ViT 的 IML 方法可作为基准,整个任务由 CNN 主导。尽管如此,CNN 在长程与非语义建模方面存在弱点。为弥补这一差距,基于伪影对图像分辨率敏感、在多尺度特征下被放大、且在篡改边界处大量存在这一事实,我们将前述问题的答案表述为:构建一个具备高分辨率能力、多尺度特征提取能力以及可在少量数据下收敛的篡改边缘监督的 ViT。我们将这一简单而有效的 ViT 范式称为 IML-ViT,其具有成为 IML 新基准的巨大潜力。在三种不同主流协议上的大量实验验证了我们的模型优于最先进的篡改定位方法。代码与模型见 https://github.com/SunnyHaze/IML-ViT。

关键词

引用

@article{arxiv.2307.14863,
  title  = {IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer},
  author = {Xiaochen Ma and Bo Du and Zhuohang Jiang and Xia Du and Ahmed Y. Al Hammadi and Jizhe Zhou},
  journal= {arXiv preprint arXiv:2307.14863},
  year   = {2024}
}