面向单图像超分辨率的高效混合 Transformer
计算机视觉与模式识别
2023-06-21 v5
摘要
近来,基于 Transformer 的方法在单图像超分辨率(SISR)中取得了令人印象深刻的成果。然而,局部性机制的缺失与高复杂度限制了其在超分辨率(SR)领域的应用。为解决这些问题,我们在本研究中提出一种新方法——高效混合 Transformer(EMT)。具体而言,我们提出由多个连续 transformer 层构成的混合 Transformer 块(MTB),其中部分层使用像素混合器(PM)替代自注意力(SA)。PM 可通过像素平移操作增强局部知识聚合。同时,由于 PM 无参数与浮点运算,不会引入额外复杂度。此外,我们采用条带窗口自注意力(SWSA),利用图像各向异性实现高效的全局依赖建模。实验结果表明,EMT 在基准数据集上优于现有方法,并取得最先进性能。代码见 https://github.com/Fried-Rice-Lab/FriedRiceLab。
引用
@article{arxiv.2305.11403,
title = {Efficient Mixed Transformer for Single Image Super-Resolution},
author = {Ling Zheng and Jinchen Zhu and Jinpeng Shi and Shizhuang Weng},
journal= {arXiv preprint arXiv:2305.11403},
year = {2023}
}
备注
Super-resolution, Long-range attention, Transformer, Locality