中文

用于图像超分辨率的递归泛化Transformer

计算机视觉与模式识别 2024-02-26 v4

摘要

Transformer架构在图像超分辨率(SR)中展现出了卓越的性能。由于Transformer中自注意力(SA)的二次计算复杂度,现有方法倾向于在局部区域内采用SA以降低开销。然而,局部设计限制了全局上下文的利用,而这对精确的图像重建至关重要。在本工作中,我们提出了用于图像SR的递归泛化Transformer(RGT),它能够捕获全局空间信息并适用于高分辨率图像。具体而言,我们提出了递归泛化自注意力(RG-SA)。它递归地将输入特征聚合为具有代表性的特征图,然后利用交叉注意力提取全局信息。同时,注意力矩阵(查询、键和值)的通道维度被进一步缩放,以减轻通道域中的冗余。此外,我们将RG-SA与局部自注意力相结合以增强全局上下文的利用,并提出了用于模块集成的混合自适应集成(HAI)。HAI允许不同层级(局部或全局)特征之间的直接有效融合。大量实验表明,我们的RGT在定量和定性上均优于近期最先进的方法。代码与预训练模型可在 https://github.com/zhengchen1999/RGT 获取。

关键词

引用

@article{arxiv.2303.06373,
  title  = {Recursive Generalization Transformer for Image Super-Resolution},
  author = {Zheng Chen and Yulun Zhang and Jinjin Gu and Linghe Kong and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2303.06373},
  year   = {2024}
}

备注

Accepted to ICLR 2024. Code is available at https://github.com/zhengchen1999/RGT