基于Vision Mamba的轻量级有效图像篡改定位网络
计算机视觉与模式识别
2025-02-17 v1 密码学与安全
摘要
当前图像篡改定位方法主要依赖卷积神经网络(CNN)和Transformer。虽然CNN受限于局部感受野,但Transformer在全局上下文建模方面具有优势,却付出了二次计算复杂度的代价。最近,基于状态空间模型Mamba已涌现出一种竞争性替代方案,使其能够以线性复杂度实现全局依赖建模。灵感来自于此,我们提出了一个基于vision Mamba的轻量级有效FORensic网络(ForMa),用于盲目图像篡改定位。首先,ForMa通过线性复杂度实现了高效的全局依赖建模,捕获多尺度全局特征。随后,采用无参数的像素洗牌层进行上采样,生成像素级定位图。此外,提出了一种噪声辅助解码策略,用于整合被篡改图像中的补充操纵痕迹,提高解码器对伪造线索的灵敏度。在10个标准数据集上的实验结果表明,ForMa实现了最先进的泛化能力和鲁棒性,同时保持最低的计算复杂度。代码已公开https://github.com/multimediaFor/ForMa。
引用
@article{arxiv.2502.09941,
title = {A Lightweight and Effective Image Tampering Localization Network with Vision Mamba},
author = {Kun Guo and Gang Cao and Zijie Lou and Xianglin Huang and Jiaoyun Liu},
journal= {arXiv preprint arXiv:2502.09941},
year = {2025}
}