中文

Contrast:面向低层视觉的Transformer与状态空间模型混合架构

计算机视觉与模式识别 2025-03-11 v2

摘要

Transformer因其强大的全局上下文建模能力而在图像超分辨率(SR)任务中越来越受欢迎,但其二次计算复杂度 necessitates 使用基于窗口的注意力机制,这限制了感受野并限制了有效的上下文扩展。最近,Mamba架构因其线性计算复杂度而成为有前景的替代方案,使其能够避免窗口机制并保持较大的感受野。然而,Mamba在处理需要高像素级精度的长程依赖时面临挑战,如SR任务所需,这是由于其隐藏状态机制会压缩和存储大量上下文,但仅以近似方式存储,导致误差,而Transformer则不受此影响。在本文中,我们提出了Contrast,一种混合SR模型,集成了Con卷积、Tr变换器和St状态空间组件,有效地将Transformer和Mamba的优势结合在一起,以解决它们各自的局限性。通过集成Transformer和状态空间机制,Contrast弥补了各自方法的不足,增强了全局上下文建模和像素级精度。我们展示了将这两种架构组合允许我们缓解各自固有的缺陷,结果在图像超分辨率任务上表现出 improved performance。

关键词

引用

@article{arxiv.2501.13353,
  title  = {Contrast: A Hybrid Architecture of Transformers and State Space Models for Low-Level Vision},
  author = {Aman Urumbekov and Zheng Chen},
  journal= {arXiv preprint arXiv:2501.13353},
  year   = {2025}
}

备注

10 pages, 6 figures