XYScanNet:单图去模糊的状态空间模型
计算机视觉与模式识别
2025-06-24 v3
摘要
深度状态空间模型(SSM),如近期的 Mamba 架构,正成为 CNN 和 Transformer 网络的有前景的替代方案。现有基于 Mamba 的恢复方法通过将图像切片转换为 1 序列的flatten-and-scan策略来处理视觉数据。然而,这种扫描范式忽略了局部像素依赖,同时通过将远距离像素错误地置于相邻位置来引入空间错位,从而降低局部噪声感知能力并损害低层视觉任务中的图像锐度。为克服这些问题,我们提出了一种新的切片扫描策略,通过在内部切片和外部切片之间交替扫描来实现。我们进一步设计了新的视觉状态空间模块(VSSM)用于图像去模糊,并解决当前 Mamba 基于视觉模块的效率问题。基于此,我们开发了 XYScanNet,这是一种集成轻量级特征融合模块以增强图像去模糊能力的 SSM 架构。XYScanNet 在保持竞争性失真指标的同时,显著提升了感知性能。实验结果表明,XYScanNet 将 KID 提升了约 。
引用
@article{arxiv.2412.10338,
title = {XYScanNet: A State Space Model for Single Image Deblurring},
author = {Hanzhou Liu and Chengkai Liu and Jiacong Xu and Peng Jiang and Mi Lu},
journal= {arXiv preprint arXiv:2412.10338},
year = {2025}
}