中文

SEM-Net:基于空间增强 SSM 的高效像素建模用于图像修复

计算机视觉与模式识别 2024-11-12 v1

摘要

图像修复旨在根据图像已知区域的信息修复部分损坏的图像。\revise{实现语义合理的修复结果尤其具有挑战性,因为它要求重建区域展现出与语义一致区域相似的模式}。这需要模型具备强大的长程依赖捕获能力。基于卷积神经网络(CNN)的方法由于感受野增长缓慢,以及基于 Transformer 方法的块级交互,在捕获长程依赖方面效率低下,这正是现有模型在此方面的困难所在。受此启发,我们提出了 SEM-Net,一种新颖的视觉状态空间模型(SSM)视觉网络,在像素级建模损坏图像,同时在状态空间中捕获长程依赖(LRD),实现线性计算复杂度。为解决 SSM 中固有的空间感知不足,我们引入了 Snake Mamba Block(SMB)和空间增强前馈网络。这些创新使 SEM-Net 在两个不同数据集上超越了最先进的修复方法,在捕获 LRD 和空间一致性增强方面表现出显著提升。此外,SEM-Net 在运动去模糊上达到了最先进性能,展示了其通用性。我们的源代码将发布在 https://github.com/ChrisChen1023/SEM-Net。

关键词

引用

@article{arxiv.2411.06318,
  title  = {SEM-Net: Efficient Pixel Modelling for image inpainting with Spatially Enhanced SSM},
  author = {Shuang Chen and Haozheng Zhang and Amir Atapour-Abarghouei and Hubert P. H. Shum},
  journal= {arXiv preprint arXiv:2411.06318},
  year   = {2024}
}

备注

Accepted by WACV 2025