HIPA:用于单图像超分辨率的分层块 Transformer
计算机视觉与模式识别
2023-06-21 v2
摘要
基于 Transformer 的架构开始出现在单图像超分辨率(SISR)中并取得了有前景的性能。大多数现有视觉 Transformer 将图像划分为相同数量、固定大小的块,这对于恢复具有不同纹理丰富度水平的块可能并非最优。本文提出 HIPA,一种新颖的 Transformer 架构,使用分层块划分逐步恢复高分辨率图像。具体而言,我们构建了一个级联模型,在多个阶段处理输入图像,从小块大小的令牌开始并逐步合并到全分辨率。这种分层块机制不仅显式地实现了多分辨率下的特征聚合,还能自适应地学习不同图像区域的块感知特征,例如对细节丰富区域使用较小块,对无纹理区域使用较大块。同时,提出了一种新的基于注意力的 Transformer 位置编码方案,通过为不同令牌分配不同权重,使网络聚焦于应更多关注哪些令牌,据我们所知这是首次。此外,我们还提出了一种新的多感受野注意力模块,以从不同分支扩大卷积感受野。在多个公开数据集上的实验结果从定量和定性上证明了所提 HIPA 优于先前方法的性能。
引用
@article{arxiv.2203.10247,
title = {HIPA: Hierarchical Patch Transformer for Single Image Super Resolution},
author = {Qing Cai and Yiming Qian and Jinxing Li and Jun Lv and Yee-Hong Yang and Feng Wu and David Zhang},
journal= {arXiv preprint arXiv:2203.10247},
year = {2023}
}