SRFormerV2:细察用于图像超分辨率的置换自注意力
计算机视觉与模式识别
2024-08-15 v2
摘要
已有工作表明,增大基于 Transformer 的图像超分辨率模型(如 SwinIR)的窗口尺寸可显著提升模型性能。然而,当窗口尺寸逐渐增大时,计算开销也相当可观。本文提出 SRFormer,一种简单而新颖的方法,既能享受大窗口自注意力的益处,又引入更少的计算负担。我们 SRFormer 的核心为置换自注意力(PSA),其在通道与空间信息之间为自注意力取得了恰当平衡。无需任何花哨技巧,我们展示了 SRFormer 在 Urban100 数据集上取得 33.86dB 的 PSNR 分数,比 SwinIR 高 0.46dB,但参数量与计算量更少。此外,我们也尝试通过进一步增大窗口尺寸与通道数来扩展模型,以探索基于 Transformer 模型的潜力。实验表明,我们所称的扩展模型 SRFormerV2 能进一步改善结果并取得最先进性能。我们希望这一简单有效的方法能对超分辨率模型设计的未来研究有所助益。主页为 https://z-yupeng.github.io/SRFormer/。
引用
@article{arxiv.2303.09735,
title = {SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution},
author = {Yupeng Zhou and Zhen Li and Chun-Le Guo and Li Liu and Ming-Ming Cheng and Qibin Hou},
journal= {arXiv preprint arXiv:2303.09735},
year = {2024}
}
备注
Previous version has been accepted by ICCV2023