中文

一种具有多域特征提取器和多感受野上采样器的视觉注意力拼接定位网络

计算机视觉与模式识别 2024-01-17 v1

摘要

图像拼接篡改对当今社会构成严峻挑战。随着图像处理工具的易得性,修改图像以误导个人、组织或社会比以往任何时候都更容易。本文提出了一种新颖的“具有多域特征提取器和多感受野上采样器的视觉注意力拼接定位网络”。它包含一个独特的“视觉注意力多域特征提取器”(VA-MDFE),从RGB、边缘和深度域中提取注意力特征。接着,“视觉注意力下采样器”(VA-DS)负责融合和下采样多域特征。最后,一个新颖的“视觉注意力多感受野上采样器”(VA-MRFU)模块利用基于多个感受野的卷积,通过聚焦不同信息尺度来上采样注意力特征。在公开基准数据集CASIA v2.0上的实验结果证明了所提模型的有效性。它以0.851的IoU分数、0.9195的像素F1分数和0.8989的像素AUC分数,轻松超越了现有的最先进方法。

关键词

引用

@article{arxiv.2401.06995,
  title  = {A Visually Attentive Splice Localization Network with Multi-Domain Feature Extractor and Multi-Receptive Field Upsampler},
  author = {Ankit Yadav and Dinesh Kumar Vishwakarma},
  journal= {arXiv preprint arXiv:2401.06995},
  year   = {2024}
}