中文

CSformer:融合卷积与Transformer的压缩感知方法

图像与视频处理 2022-01-03 v1 计算机视觉与模式识别

摘要

卷积神经网络(CNN)已在压缩图像感知中取得成功。然而,由于局部性与权值共享的归纳偏置,卷积操作在建模长程依赖方面存在固有局限。Transformer最初被设计为序列到序列模型,基于自注意力的架构擅长捕捉全局上下文,尽管其局部化能力可能有限。本文提出CSformer,一种混合框架,它结合了CNN提供的细节空间信息与Transformer提供的全局上下文的优势,以增强表征学习。所提方法是一种端到端的压缩图像感知方法,由自适应采样与恢复组成。在采样模块中,图像由学习到的采样矩阵逐块测量。在重建阶段,测量结果被投影到双分支中。其一为CNN分支,通过卷积建模邻域关系;另一为Transformer分支,采用全局自注意力机制。双分支结构并行,局部特征与全局表征在不同分辨率下融合以最大化特征互补。此外,我们探索了渐进策略与基于窗口的Transformer块,以降低参数量与计算复杂度。实验结果表明了专为压缩感知设计的基于Transformer架构的有效性,其在不同数据集上相比SOTA方法取得了更优性能。

关键词

引用

@article{arxiv.2112.15299,
  title  = {CSformer: Bridging Convolution and Transformer for Compressive Sensing},
  author = {Dongjie Ye and Zhangkai Ni and Hanli Wang and Jian Zhang and Shiqi Wang and Sam Kwong},
  journal= {arXiv preprint arXiv:2112.15299},
  year   = {2022}
}