中文

在图像超分辨率中激活更广泛区域

计算机视觉与模式识别 2024-03-14 v1

摘要

卷积神经网络(CNNs)和视觉Transformer(ViTs)的普及显著革新了单图像超分辨率(SISR)领域。为了进一步提升SR性能,引入了诸如残差学习和注意力机制等多种技术,这在很大程度上可归因于更广泛的激活区域,即对SR结果有强烈影响的输入像素。然而,通过另一种通用的视觉骨干网络进一步提高SR性能的可能性仍然是一个未解决的挑战。为了解决这个问题,在本文中,我们释放了现代状态空间模型,即Vision Mamba(Vim),在SISR背景下的表示潜力。具体来说,我们提出了三条更好地利用基于Vim模型的方案:1)集成到MetaFormer风格的模块中;2)在更大更广的数据集上进行预训练;3)采用互补的注意力机制,在此基础上我们引入了MMA。由此产生的网络MMA能够找到最相关和最具代表性的输入像素来重建相应的高分辨率图像。全面的实验分析表明,与最先进的SISR方法相比,MMA不仅实现了有竞争力甚至更优越的性能,而且保持了相对较低的内存和计算开销(例如,在Manga109数据集上,以19.8M参数在2倍放大尺度下提升了+0.5 dB PSNR)。此外,MMA在轻量级SR应用中证明了其多功能性。通过这项工作,我们旨在阐明状态空间模型在更广泛的图像处理领域而非仅限于SISR中的潜在应用,鼓励在这一创新方向上的进一步探索。

关键词

引用

@article{arxiv.2403.08330,
  title  = {Activating Wider Areas in Image Super-Resolution},
  author = {Cheng Cheng and Hang Wang and Hongbin Sun},
  journal= {arXiv preprint arXiv:2403.08330},
  year   = {2024}
}

备注

19 pages, 7 figures