中文

用高效卷积网络重新审视图像去模糊

计算机视觉与模式识别 2023-02-07 v1

摘要

图像去模糊旨在从其模糊的对应图像中恢复潜在的清晰图像,在计算机视觉中有着广泛的应用。卷积神经网络(CNNs)多年来在该领域表现良好,直到最近,一种替代网络架构,即 Transformer,展示了更强的性能。其优越性可归因于多头自注意力(MHSA)机制,该机制提供了比 CNN 更大的感受野和更好的输入内容适应性。然而,由于 MHSA 要求高昂的计算成本,且该成本随输入分辨率呈二次方增长,这使得它对于高分辨率图像去模糊任务变得不切实际。在这项工作中,我们提出了一种统一的轻量级 CNN 网络,其特点是具有大的有效感受野(ERF),并且展示了与 Transformer 相当甚至更好的性能,同时计算成本更低。我们的关键设计是一个名为 LaKD 的高效 CNN 模块,它配备了大核深度卷积和空间-通道混合结构,获得了与 Transformer 相当或更大的 ERF,但参数规模更小。具体而言,在散焦/运动去模糊基准数据集上,我们比最先进的 Restormer 实现了 +0.17dB / +0.43dB 的 PSNR 提升,同时参数减少了 32%,MACs 减少了 39%。大量实验证明了我们网络的优越性能以及每个模块的有效性。此外,我们提出了一个紧凑且直观的 ERFMeter 度量标准,用于定量表征 ERF,并显示出与网络性能的高度相关性。我们希望这项工作能激励研究界在图像去模糊任务之外,进一步探索 CNN 和 Transformer 架构的优缺点。

关键词

引用

@article{arxiv.2302.02234,
  title  = {Revisiting Image Deblurring with an Efficient ConvNet},
  author = {Lingyan Ruan and Mojtaba Bemana and Hans-peter Seidel and Karol Myszkowski and Bin Chen},
  journal= {arXiv preprint arXiv:2302.02234},
  year   = {2023}
}

备注

30 pages (12 pages for the main manuscript and 18 for the supplementary materials)