HiTSR:用于基于参考图像的超分辨率的分层Transformer
计算机视觉与模式识别
2024-09-02 v1
摘要
在本文中,我们提出了HiTSR,一种用于基于参考图像超分辨率的分层Transformer模型,该模型通过从高分辨率参考图像中学习匹配对应关系来增强低分辨率输入图像。与现有的多网络、多阶段方法不同,我们通过引入GAN文献中的双重注意力块来简化架构和训练流程。在独立处理两个视觉流的同时,我们通过门控注意力策略融合自注意力块和交叉注意力块。该模型集成了挤压与激励模块以从输入图像中捕获全局上下文,从而促进基于窗口的注意力块内的长距离空间交互。浅层和深层之间的长跳跃连接进一步增强了信息流。我们的模型在包括SUN80、Urban100和Manga109在内的三个数据集上表现出卓越的性能。具体而言,在SUN80数据集上,我们的模型达到了30.24/0.821的PSNR/SSIM值。这些结果突出了注意力机制在基于参考图像超分辨率中的有效性。该基于Transformer的模型无需专用子网络、知识蒸馏或多阶段训练即可达到SOTA结果,强调了注意力机制在满足基于参考图像超分辨率需求方面的有效性。
引用
@article{arxiv.2408.16959,
title = {HiTSR: A Hierarchical Transformer for Reference-based Super-Resolution},
author = {Masoomeh Aslahishahri and Jordan Ubbens and Ian Stavness},
journal= {arXiv preprint arXiv:2408.16959},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2307.08837