基于状态空间模型的图像篡改定位
计算机视觉与模式识别
2025-02-17 v2
摘要
从篡改图像中建模像素依赖关系对于图像篡改定位至关重要。现有方法主要依赖卷积神经网络(CNN)或基于 Transformer 的模型,这些方法往往要么缺乏足够的感受野,要么带来显著的计算开销。近期,状态空间模型(SSMs),以 Mamba 为代表,作为一种有前景的方法涌现出来。它们不仅擅长建模长程交互,还保持了线性计算复杂度。在本文中,我们提出了 LoMa,一种利用选择性 SSMs 的新型图像篡改定位方法。具体而言,LoMa 首先采用空洞选择性扫描遍历空间域,将篡改图像转换为有序块序列,然后应用多方向状态空间建模。此外,引入了一个辅助卷积分支以增强局部特征提取。大量实验结果验证了 LoMa 相对于基于 CNN 和基于 Transformer 的最先进方法的优越性。据我们所知,这是第一个基于 SSM 模型构建的图像篡改定位模型。我们旨在建立一个基线,并为未来开发更高效、更有效的基于 SSM 的篡改定位模型提供有价值的见解。代码可在 https://github.com/multimediaFor/LoMa 获取。
引用
@article{arxiv.2412.11214,
title = {Image Forgery Localization with State Space Models},
author = {Zijie Lou and Gang Cao and Kun Guo and Shaowei Weng and Lifang Yu},
journal= {arXiv preprint arXiv:2412.11214},
year = {2025}
}