用于单图像超分辨率的 Transformer
计算机视觉与模式识别
2022-04-25 v3
摘要
随着深度学习的发展,单图像超分辨率(SISR)取得了长足进步。然而,现有的大多数研究侧重于构建具有大量层数的更复杂网络。最近,越来越多的研究人员开始探索 Transformer 在计算机视觉任务中的应用。然而,视觉 Transformer 的巨大计算成本和高 GPU 内存占用不容忽视。在本文中,我们提出了一种用于 SISR 的新型高效超分辨率 Transformer(ESRT)。ESRT 是一个混合模型,由轻量级 CNN 主干(LCB)和轻量级 Transformer 主干(LTB)组成。其中,LCB 能够动态调整特征图大小,以较低的计算成本提取深度特征。LTB 由一系列高效 Transformer(ET)组成,得益于专门设计的高效多头注意力(EMHA),其 GPU 内存占用较小。大量实验表明,ESRT 在低计算成本下取得了有竞争力的结果。与占用 16,057M GPU 内存的原版 Transformer 相比,ESRT 仅占用 4,191M GPU 内存。所有代码可在 https://github.com/luissen/ESRT 获取。
引用
@article{arxiv.2108.11084,
title = {Transformer for Single Image Super-Resolution},
author = {Zhisheng Lu and Juncheng Li and Hong Liu and Chaoyan Huang and Linlin Zhang and Tieyong Zeng},
journal= {arXiv preprint arXiv:2108.11084},
year = {2022}
}
备注
Accepted by CVPR workshop 2022