HMANet:用于图像超分辨率的混合多轴聚合网络
计算机视觉与模式识别
2024-05-09 v1
摘要
基于 Transformer 的方法在超分辨率视觉任务中展现出了优异的性能,超越了传统的卷积神经网络。然而,现有工作通常将自注意力计算限制在非重叠窗口内以节省计算成本。这意味着基于 Transformer 的网络只能使用有限空间范围内的输入信息。因此,本文提出了一种新颖的混合多轴聚合网络 (HMA),以更好地挖掘特征潜在信息。HMA 由堆叠的残差混合 Transformer 模块 (RHTB) 和网格注意力模块 (GAB) 构成。一方面,RHTB 结合通道注意力和自注意力以增强非局部特征融合,并产生更具吸引力的视觉效果。另一方面,GAB 用于跨域信息交互,以联合建模相似特征并获得更大的感受野。对于训练阶段的超分辨率任务,设计了一种新颖的预训练方法以进一步增强模型表示能力,并通过大量实验验证了所提出模型的有效性。实验结果表明,HMA 在基准数据集上优于 SOTA 方法。我们在 https://github.com/korouuuuu/HMA 提供了代码和模型。
关键词
引用
@article{arxiv.2405.05001,
title = {HMANet: Hybrid Multi-Axis Aggregation Network for Image Super-Resolution},
author = {Shu-Chuan Chu and Zhi-Chao Dou and Jeng-Shyang Pan and Shaowei Weng and Junbao Li},
journal= {arXiv preprint arXiv:2405.05001},
year = {2024}
}
备注
12 pages, 10 figures, conference