中文

用于图像复原的跨聚合 Transformer

计算机视觉与模式识别 2023-03-24 v2

摘要

近来,Transformer 架构被引入图像复原中以替代卷积神经网络(CNN),取得了令人惊讶的效果。考虑到具有全局注意力的 Transformer 的高计算复杂度,一些方法使用局部方形窗口来限制自注意力的范围。然而,这些方法缺乏不同窗口之间的直接交互,限制了长程依赖的建立。为解决上述问题,我们提出了一种新的图像复原模型——跨聚合 Transformer(CAT)。我们 CAT 的核心为矩形窗口自注意力(Rwin-SA),其在不同头中并行利用水平和垂直矩形窗口注意力来扩展注意力区域并跨不同窗口聚合特征。我们还引入了轴向位移操作以实现不同窗口交互。此外,我们提出了局部互补模块来补充自注意力机制,其将 CNN 的归纳偏置(如平移不变性与局部性)引入 Transformer,实现全局-局部耦合。大量实验表明,我们的 CAT 在多个图像复原应用上优于近期最先进的方法。代码与模型可在 https://github.com/zhengchen1999/CAT 获取。

关键词

引用

@article{arxiv.2211.13654,
  title  = {Cross Aggregation Transformer for Image Restoration},
  author = {Zheng Chen and Yulun Zhang and Jinjin Gu and Yongbing Zhang and Linghe Kong and Xin Yuan},
  journal= {arXiv preprint arXiv:2211.13654},
  year   = {2023}
}

备注

Accepted to NeurIPS 2022. Code is available at https://github.com/zhengchen1999/CAT