Segmenter:用于语义分割的Transformer
计算机视觉与模式识别
2021-09-03 v3 人工智能
机器学习
摘要
图像分割在单个图像块层面上常具有歧义性,需要上下文信息以达成标签共识。本文引入Segmenter,一种用于语义分割的transformer模型。与基于卷积的方法不同,我们的方法从第一层起直至整个网络都能建模全局上下文。我们基于近期的Vision Transformer (ViT)构建并将其扩展到语义分割。为此,我们依赖于对应图像块的输出嵌入,并通过逐点线性解码器或掩码transformer解码器从这些嵌入获得类别标签。我们利用为图像分类预训练的模型,并表明我们可在语义分割可用的中等规模数据集上对其进行微调。线性解码器已能取得优异结果,而由掩码transformer生成类别掩码可进一步提升性能。我们进行了广泛的消融研究以展示不同参数的影响,特别是大模型与小图像块尺寸下性能更优。Segmenter在语义分割上取得了优异结果。它在ADE20K和Pascal Context数据集上均优于最先进水平,并在Cityscapes上具有竞争力。
引用
@article{arxiv.2105.05633,
title = {Segmenter: Transformer for Semantic Segmentation},
author = {Robin Strudel and Ricardo Garcia and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:2105.05633},
year = {2021}
}
备注
ICCV 2021. Code available at https://github.com/rstrudel/segmenter