逐像素分类并非语义分割的一切所需
计算机视觉与模式识别
2021-11-02 v2
摘要
现代方法通常将语义分割表述为逐像素分类任务,而实例级分割则由另一种掩码分类处理。我们的核心见解:掩码分类具有足够的通用性,可使用完全相同的模型、损失与训练过程以统一方式解决语义级与实例级分割任务。遵循此观察,我们提出 MaskFormer,一种简单的掩码分类模型,其预测一组二值掩码,每个掩码关联一个全局类标签预测。总体而言,所提出的基于掩码分类的方法简化了语义与全景分割任务有效方法的格局,并展现出优异的经验结果。特别地,我们观察到当类别数较大时 MaskFormer 优于逐像素分类基线。我们基于掩码分类的方法优于当前最先进的语义(ADE20K 上 55.6 mIoU)与全景分割(COCO 上 52.7 PQ)模型。
引用
@article{arxiv.2107.06278,
title = {Per-Pixel Classification is Not All You Need for Semantic Segmentation},
author = {Bowen Cheng and Alexander G. Schwing and Alexander Kirillov},
journal= {arXiv preprint arXiv:2107.06278},
year = {2021}
}
备注
NeurIPS 2021, Spotlight. Project page: https://bowenc0221.github.io/maskformer