Contrast:面向低层视觉的Transformer与状态空间模型混合架构
计算机视觉与模式识别
2025-03-11 v2
摘要
Transformer因其强大的全局上下文建模能力而在图像超分辨率(SR)任务中越来越受欢迎,但其二次计算复杂度 necessitates 使用基于窗口的注意力机制,这限制了感受野并限制了有效的上下文扩展。最近,Mamba架构因其线性计算复杂度而成为有前景的替代方案,使其能够避免窗口机制并保持较大的感受野。然而,Mamba在处理需要高像素级精度的长程依赖时面临挑战,如SR任务所需,这是由于其隐藏状态机制会压缩和存储大量上下文,但仅以近似方式存储,导致误差,而Transformer则不受此影响。在本文中,我们提出了Contrast,一种混合SR模型,集成了Con卷积、Tr变换器和St状态空间组件,有效地将Transformer和Mamba的优势结合在一起,以解决它们各自的局限性。通过集成Transformer和状态空间机制,Contrast弥补了各自方法的不足,增强了全局上下文建模和像素级精度。我们展示了将这两种架构组合允许我们缓解各自固有的缺陷,结果在图像超分辨率任务上表现出 improved performance。
引用
@article{arxiv.2501.13353,
title = {Contrast: A Hybrid Architecture of Transformers and State Space Models for Low-Level Vision},
author = {Aman Urumbekov and Zheng Chen},
journal= {arXiv preprint arXiv:2501.13353},
year = {2025}
}
备注
10 pages, 6 figures