CFAT:释放三角窗用于图像超分辨率
图像与视频处理
2024-03-26 v1 计算机视觉与模式识别
机器学习
多媒体
摘要
基于 Transformer 的模型利用其捕获复杂上下文特征的固有能力,彻底改变了图像超分辨率(SR)领域。如今在 Transformer 架构中使用的重叠矩形移位窗口技术是超分辨率模型中的常见做法,旨在提高图像上采样的质量和鲁棒性。然而,它存在边界失真问题且独特的移位模式有限。为了克服这些缺点,我们提出了一种非重叠三角窗技术,该技术与矩形窗同步工作以减轻边界级失真,并允许模型访问更多独特的移位模式。在本文中,我们提出了一种复合融合注意力 Transformer(CFAT),它在图像超分辨率中将基于三角-矩形窗的局部注意力与基于通道的全局注意力技术相结合。因此,CFAT 使注意力机制能够在更多图像像素上被激活,并捕获长距离、多尺度特征以提高 SR 性能。广泛的实验结果和消融研究证明了 CFAT 在 SR 领域的有效性。我们提出的模型比其他最先进的 SR 架构表现出显著的 0.7 dB 性能提升。
关键词
引用
@article{arxiv.2403.16143,
title = {CFAT: Unleashing TriangularWindows for Image Super-resolution},
author = {Abhisek Ray and Gaurav Kumar and Maheshkumar H. Kolekar},
journal= {arXiv preprint arXiv:2403.16143},
year = {2024}
}
备注
Accepted to CVPR 2024