中文

基于线性Transformer的无头部轻量语义分割

计算机视觉与模式识别 2023-06-21 v4 计算与语言

摘要

现有语义分割工作主要集中于设计有效的解码器;然而,整体结构引入的计算负载长期被忽视,这阻碍其在资源受限硬件上的应用。本文提出一种专为语义分割设计的无头部轻量架构,名为自适应频率Transformer(Adaptive Frequency Transformer)。它采用并行架构,利用原型表示作为特定的可学习局部描述,以替代解码器并在高分辨率特征上保留丰富图像语义。尽管移除解码器压缩了大部分计算,并行结构的精度仍受低计算资源限制。因此,我们采用异构算子(CNN与Vision Transformer)分别进行像素嵌入与原型表示,以进一步节省计算成本。此外,从空间域角度将视觉Transformer复杂度线性化非常困难。由于语义分割对频率信息十分敏感,我们构建了具有自适应频率滤波、复杂度为O(n)O(n)的轻量原型学习块,以替代复杂度为O(n2)O(n^{2})的标准自注意力。在广泛采用的数据集上的大量实验表明,我们的模型在仅保留3M参数的同时取得了优越精度。在ADE20K数据集上,我们的模型取得41.8 mIoU与4.6 GFLOPs,比Segformer高4.4 mIoU且GFLOPs减少45%。在Cityscapes数据集上,我们的模型取得78.7 mIoU与34.4 GFLOPs,比Segformer高2.5 mIoU且GFLOPs减少72.5%。代码见https://github.com/dongbo811/AFFormer。

关键词

引用

@article{arxiv.2301.04647,
  title  = {EXIF as Language: Learning Cross-Modal Associations Between Images and Camera Metadata},
  author = {Chenhao Zheng and Ayush Shrivastava and Andrew Owens},
  journal= {arXiv preprint arXiv:2301.04647},
  year   = {2023}
}

备注

CVPR 2023 (Highlight). Project link: http://hellomuffin.github.io/exif-as-language