MAT:用于高效图像超分辨率的多范围注意力 Transformer
计算机视觉与模式识别
2025-03-20 v3
摘要
图像超分辨率 (SR) 通过采用 Transformer 架构取得了显著进展。然而,传统技术旨在扩大自注意力窗口以捕获更广阔的上下文,但带来固有的缺点,尤其是计算需求的显著增加。此外,现有模型在固定大小窗口内的特征感知限制了有效感受野 (ERF) 和中间特征的多样性。我们证明,跨越多种空间范围的灵活注意力集成可带来显著的性能提升。基于这一洞察,我们引入了用于 SR 任务的多范围注意力 Transformer (MAT)。MAT 利用膨胀运算固有的计算优势,结合自注意力机制,以实现多范围注意力 (MA) 和稀疏多范围注意力 (SMA),高效捕获区域和稀疏全局特征。结合局部特征提取,MAT 能有效捕获各种空间范围内的依赖关系,提高其特征表示的多样性和效能。我们还引入了 MSConvStar 模块,增强了模型进行多范围表示学习的能力。全面实验表明,我们的 MAT 在性能上优于现有最先进的 SR 模型,同时具有显著的效率(约快 3.3 倍)。
引用
@article{arxiv.2411.17214,
title = {MAT: Multi-Range Attention Transformer for Efficient Image Super-Resolution},
author = {Chengxing Xie and Xiaoming Zhang and Linze Li and Yuqian Fu and Biao Gong and Tianrui Li and Kai Zhang},
journal= {arXiv preprint arXiv:2411.17214},
year = {2025}
}
备注
IEEE CSVT