中文

用卷积模拟自注意力以实现高效的图像超分辨率

计算机视觉与模式识别 2025-07-01 v2

摘要

在本文中,我们致力于解决 Transformer 用于高效图像超分辨率(SR)时的高计算开销问题。受自注意力层间重复现象的启发,我们引入了一个名为卷积注意力(ConvAttn)的卷积化自注意力模块,该模块利用单个共享大核和动态核来模拟自注意力的长程建模能力和实例依赖加权。通过利用 ConvAttn 模块,我们显著降低了对自注意力及其涉及的内存受限操作的依赖,同时保持了 Transformer 的表征能力。此外,我们克服了将 flash attention 集成到轻量级 SR 机制中的挑战,有效缓解了自注意力固有的内存瓶颈。我们使用 flash attention 将窗口尺寸扩大到 32×\times32,而不是提出复杂的自注意力模块,在 Urban100×\times2 上将 PSNR 显著提高了 0.31dB,同时延迟和内存使用分别降低了 16×\times 和 12.2×\times。基于这些方法,我们提出的网络称为用卷积模拟自注意力(ESC),与 HiT-SRF 相比,在 Urban100×\times4 上将 PSNR 显著提高了 0.27 dB,延迟和内存使用分别降低了 3.7×\times 和 6.2×\times。大量实验表明,尽管大部分自注意力被 ConvAttn 模块取代,我们的 ESC 仍保持了 Transformer 的长程建模能力、数据可扩展性和表征能力。

关键词

引用

@article{arxiv.2503.06671,
  title  = {Emulating Self-attention with Convolution for Efficient Image Super-Resolution},
  author = {Dongheon Lee and Seokju Yun and Youngmin Ro},
  journal= {arXiv preprint arXiv:2503.06671},
  year   = {2025}
}

备注

ICCV 2025