中文

Segmenter:用于语义分割的Transformer

计算机视觉与模式识别 2021-09-03 v3 人工智能 机器学习

摘要

图像分割在单个图像块层面上常具有歧义性,需要上下文信息以达成标签共识。本文引入Segmenter,一种用于语义分割的transformer模型。与基于卷积的方法不同,我们的方法从第一层起直至整个网络都能建模全局上下文。我们基于近期的Vision Transformer (ViT)构建并将其扩展到语义分割。为此,我们依赖于对应图像块的输出嵌入,并通过逐点线性解码器或掩码transformer解码器从这些嵌入获得类别标签。我们利用为图像分类预训练的模型,并表明我们可在语义分割可用的中等规模数据集上对其进行微调。线性解码器已能取得优异结果,而由掩码transformer生成类别掩码可进一步提升性能。我们进行了广泛的消融研究以展示不同参数的影响,特别是大模型与小图像块尺寸下性能更优。Segmenter在语义分割上取得了优异结果。它在ADE20K和Pascal Context数据集上均优于最先进水平,并在Cityscapes上具有竞争力。

关键词

引用

@article{arxiv.2105.05633,
  title  = {Segmenter: Transformer for Semantic Segmentation},
  author = {Robin Strudel and Ricardo Garcia and Ivan Laptev and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2105.05633},
  year   = {2021}
}

备注

ICCV 2021. Code available at https://github.com/rstrudel/segmenter