SEM-Net:基于空间增强 SSM 的高效像素建模用于图像修复
计算机视觉与模式识别
2024-11-12 v1
摘要
图像修复旨在根据图像已知区域的信息修复部分损坏的图像。\revise{实现语义合理的修复结果尤其具有挑战性,因为它要求重建区域展现出与语义一致区域相似的模式}。这需要模型具备强大的长程依赖捕获能力。基于卷积神经网络(CNN)的方法由于感受野增长缓慢,以及基于 Transformer 方法的块级交互,在捕获长程依赖方面效率低下,这正是现有模型在此方面的困难所在。受此启发,我们提出了 SEM-Net,一种新颖的视觉状态空间模型(SSM)视觉网络,在像素级建模损坏图像,同时在状态空间中捕获长程依赖(LRD),实现线性计算复杂度。为解决 SSM 中固有的空间感知不足,我们引入了 Snake Mamba Block(SMB)和空间增强前馈网络。这些创新使 SEM-Net 在两个不同数据集上超越了最先进的修复方法,在捕获 LRD 和空间一致性增强方面表现出显著提升。此外,SEM-Net 在运动去模糊上达到了最先进性能,展示了其通用性。我们的源代码将发布在 https://github.com/ChrisChen1023/SEM-Net。
引用
@article{arxiv.2411.06318,
title = {SEM-Net: Efficient Pixel Modelling for image inpainting with Spatially Enhanced SSM},
author = {Shuang Chen and Haozheng Zhang and Amir Atapour-Abarghouei and Hubert P. H. Shum},
journal= {arXiv preprint arXiv:2411.06318},
year = {2024}
}
备注
Accepted by WACV 2025