中文

M2SFormer:结合边缘感知难度引导的多光谱与多尺度注意力用于图像篡改定位

计算机视觉与模式识别 2025-06-27 v1

摘要

图像编辑技术快速发展,既促进了创新应用,也助长了对数字图像的恶意篡改。基于深度学习的方法近期在像素级篡改定位中实现了高精度,但常面临计算开销大与表征能力有限的问题,尤其在处理细微或复杂篡改时。本文提出 M2SFormer,一种基于 Transformer 编码器的新颖框架,旨在克服这些挑战。与分别处理空间与频率线索的方法不同,M2SFormer 在跳跃连接中统一多频率与多尺度注意力,利用全局上下文以更好地捕获多样篡改痕迹。此外,我们的框架通过利用全局先验图(一种指示篡改定位难度的曲率指标)解决上采样过程中细节丢失的问题,随后引导难度引导注意力模块以更有效地保留细微篡改。在多个基准数据集上的广泛实验表明,M2SFormer 优于现有最先进模型,在跨未见领域的篡改检测与定位中展现出卓越的泛化能力。

关键词

引用

@article{arxiv.2506.20922,
  title  = {M2SFormer: Multi-Spectral and Multi-Scale Attention with Edge-Aware Difficulty Guidance for Image Forgery Localization},
  author = {Ju-Hyeon Nam and Dong-Hyun Moon and Sang-Chul Lee},
  journal= {arXiv preprint arXiv:2506.20922},
  year   = {2025}
}

备注

Accepted in International Conference on Computer Vision (ICCV) 2025