中文

基于可伸缩注意力 Transformer 的精确图像复原

计算机视觉与模式识别 2023-02-06 v4

摘要

近来,基于 Transformer 的图像复原网络因参数无关的全局交互而相较卷积神经网络取得了可喜的改进。为降低计算开销,现有工作通常将自注意力计算限制在非重叠窗口内。然而,每组 token 总来自图像的密集区域。这被视为一种密集注意力策略,因为 token 间的交互被约束于密集区域中。显然,该策略会导致受限的 receptive field(感受野)。为解决此问题,我们提出用于图像复原的注意力可伸缩 Transformer(ART),其在网络中同时呈现密集与稀疏注意力模块。稀疏注意力模块允许来自稀疏区域的 token 进行交互,从而提供更宽的感受野。此外,密集与稀疏注意力模块的交替应用在提供对输入图像的可伸缩注意力的同时极大增强了 Transformer 的表示能力。我们在图像超分辨率、去噪及 JPEG 压缩伪影去除任务上进行了广泛实验。实验结果证实,我们所提 ART 在各类基准数据集上于定量与视觉方面均优于 SOTA 方法。我们亦在 https://github.com/gladzhang/ART 提供代码与模型。

关键词

引用

@article{arxiv.2210.01427,
  title  = {Accurate Image Restoration with Attention Retractable Transformer},
  author = {Jiale Zhang and Yulun Zhang and Jinjin Gu and Yongbing Zhang and Linghe Kong and Xin Yuan},
  journal= {arXiv preprint arXiv:2210.01427},
  year   = {2023}
}

备注

Accepted to ICLR 2023. Code and models are available at https://github.com/gladzhang/ART