SAAT:用于图像超分辨率的协同交替聚合Transformer
计算机视觉与模式识别
2025-06-05 v1 人工智能
摘要
单图像超分辨率是一项旨在将低分辨率图像恢复为高分辨率图像的知名下游任务。目前,基于Transformer的模型在该领域表现出色,因为它们能够捕捉信息中的长期依赖关系。然而,现有方法通常计算非重叠窗口内的自注意力以节省计算成本,且标准自注意力计算仅关注其结果,从而忽略了通道间以及在中间过程中产生的丰富空间结构信息。通道注意力和空间注意力分别在提取特征依赖性和空间结构关系方面为各种下游视觉任务带来了显著改进,但通道注意力与空间注意力之间的协同关系尚未得到充分探索。为了解决这些问题,我们提出了一种新型模型——协同交替聚合Transformer(SAAT),它能够更好地利用特征的潜在信息。在SAAT中,我们引入了高效通道与窗口协同注意力组(CWSAG)以及空间与窗口协同注意力组(SWSAG)。一方面,CWSAG将高效通道注意力与移位窗口注意力相结合,增强了非局部特征融合,从而产生更具视觉吸引力的结果。另一方面,SWSAG利用空间注意力捕获丰富的结构化特征信息,从而使SAAT能够更有效地提取结构特征。广泛的实验结果和消融研究证明了SAAT在超分辨率领域的有效性。SAAT在相同参数数量下实现了与最先进方法(SOTA)相当的性能。
引用
@article{arxiv.2506.03740,
title = {SAAT: Synergistic Alternating Aggregation Transformer for Image Super-Resolution},
author = {Jianfeng Wu and Nannan Xu},
journal= {arXiv preprint arXiv:2506.03740},
year = {2025}
}