中文

用于语义分割的多尺度高分辨率视觉Transformer

计算机视觉与模式识别 2021-11-24 v2 人工智能 机器学习

摘要

视觉Transformer(ViT)相较于基于卷积神经网络(CNN)的模型,在计算机视觉任务上展现出优越性能。然而,ViT主要面向图像分类设计,生成单尺度低分辨率表征,这使得语义分割等密集预测任务对ViT而言具有挑战性。为此,我们提出HRViT,通过将对高分率多分支架构与ViT相集成,增强ViT学习语义丰富且空间精确的多尺度表征的能力。我们通过多种分支-模块协同优化技术平衡HRViT的性能与效率。具体而言,我们探索异构分支设计、降低线性层中的冗余,并以增强的表达能力扩充注意力模块。正如我们在ADE20K和Cityscapes上的评估结果所示,这些方法使HRViT将语义分割性能与效率的帕累托前沿推向新高度。HRViT在ADE20K上取得50.20% mIoU,在Cityscapes上取得83.16% mIoU,以平均+1.78 mIoU提升、28%参数量节省和21% FLOPs削减超越SOTA的MiT与CSWin骨干网络,展示了HRViT作为语义分割强大视觉骨干的潜力。

关键词

引用

@article{arxiv.2111.01236,
  title  = {Multi-Scale High-Resolution Vision Transformer for Semantic Segmentation},
  author = {Jiaqi Gu and Hyoukjun Kwon and Dilin Wang and Wei Ye and Meng Li and Yu-Hsin Chen and Liangzhen Lai and Vikas Chandra and David Z. Pan},
  journal= {arXiv preprint arXiv:2111.01236},
  year   = {2021}
}

备注

8 pages