CATANet:用于轻量级图像超分辨率的高效内容感知 Token 聚合
计算机视觉与模式识别
2025-03-11 v1
摘要
基于 Transformer 的方法在图像超分辨率 (SR) 等低级视觉任务中展现出了令人印象深刻的性能。然而,其计算复杂度随空间分辨率呈二次增长。一系列工作试图通过将低分辨率图像划分为局部窗口、轴向条带或膨胀窗口来缓解这一问题。SR 通常利用图像的冗余进行重建,而这种冗余不仅出现在局部区域,也出现在远程区域。然而,这些方法将注意力计算限制在与内容无关的局部区域内,直接限制了注意力捕获远程依赖的能力。为了解决这些问题,我们提出了一种轻量级的内容感知 Token 聚合网络 (CATANet)。具体而言,我们提出了一个高效的内容感知 Token 聚合模块,用于聚合远程内容相似的 Token,该模块在所有图像 Token 间共享 Token 中心,并仅在训练阶段更新它们。然后我们利用组内自注意力来实现远程信息交互。此外,我们设计了组间交叉注意力以进一步增强全局信息交互。实验结果表明,与最先进的基于聚类的方法 SPIN 相比,我们的方法取得了更优的性能,PSNR 最大提升 0.33dB,且推理速度几乎翻倍。
引用
@article{arxiv.2503.06896,
title = {CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-Resolution},
author = {Xin Liu and Jie Liu and Jie Tang and Gangshan Wu},
journal= {arXiv preprint arXiv:2503.06896},
year = {2025}
}
备注
Accepted by CVPR2025