中文

面向图像篡改定位的感知型MAE:关注低层特征的高层视觉学习器

计算机视觉与模式识别 2023-10-11 v1

摘要

如今,由于多媒体生成技术的快速发展,多媒体取证面临前所未有的挑战,从而使得图像篡改定位(IML)在追求真相中至关重要。IML的关键在于揭示篡改区域与真实区域之间的伪影或不一致,这些在像素级特征下十分明显。因此,现有研究将IML视为低层视觉任务,专注于通过构建像素级特征(如图像RGB噪声、边缘信号或高频特征)来分配篡改掩码。然而,在实践中,篡改通常发生在目标层级,且不同类别的目标成为篡改对象的可能性各异。因此,除像素级特征外,目标语义在识别篡改区域中也至关重要。这需要IML模型对整幅图像进行语义理解。本文中,我们将IML任务重新表述为一个极大受益于低层特征的高层视觉任务。基于此种解读,我们提出一种通过引入高分辨率输入和感知损失监督模块来增强掩码自编码器(MAE)的方法,称为感知型MAE(PMAE)。尽管MAE已展现出对目标语义的卓越理解能力,PMAE凭借我们所提出的增强手段亦能弥补低层语义的不足。大量实验表明,该范式有效统一了IML任务的低层与高层特征,并在全部五个公开数据集上优于最先进的篡改定位方法。

关键词

引用

@article{arxiv.2310.06525,
  title  = {Perceptual MAE for Image Manipulation Localization: A High-level Vision Learner Focusing on Low-level Features},
  author = {Xiaochen Ma and Jizhe Zhou and Xiong Xu and Zhuohang Jiang and Chi-Man Pun},
  journal= {arXiv preprint arXiv:2310.06525},
  year   = {2023}
}