MaxSR:基于改进 MaxViT 的图像超分辨率
计算机视觉与模式识别
2023-07-17 v1
摘要
虽然 transformer 模型已被证明对自然语言处理任务和高层视觉任务有效,但仅有少数尝试将强大的 transformer 模型用于单幅图像超分辨率。由于 transformer 模型具有强大的表征能力,且其内建的自注意力机制有助于利用输入低分辨率图像中的自相似先验来提升单幅图像超分辨率性能,我们提出了一种基于近期 MaxViT 混合视觉 transformer 的单幅图像超分辨率模型,称为 MaxSR。MaxSR 由四部分组成:浅层特征提取块、多个级联的自适应 MaxViT 块(用于高效提取深度层次特征并从低层特征建模全局自相似)、层次特征融合块,以及最后的重建块。MaxSR 的关键组件即自适应 MaxViT 块,基于 MaxViT 块,后者将 MBConv 与挤压激励(squeeze-and-excitation)、块注意力(block attention)和网格注意力(grid attention)相混合。为了更好地对输入低分辨率图像中的自相似进行全局建模,我们改进了 MaxViT 块中的块注意力和网格注意力,提出自适应块注意力和自适应网格注意力,分别以最有效的方式在每个窗口内跨所有网格、以及每个网格内跨所有窗口进行自注意力计算。我们针对经典单幅图像超分辨率(MaxSR)和轻量单幅图像超分辨率(MaxSR-light)实例化了所提模型。实验表明,我们的 MaxSR 和 MaxSR-light 高效地建立了新的 SOTA 性能。
引用
@article{arxiv.2307.07240,
title = {MaxSR: Image Super-Resolution Using Improved MaxViT},
author = {Bincheng Yang and Gangshan Wu},
journal= {arXiv preprint arXiv:2307.07240},
year = {2023}
}