重新思考语义分割:一种原型视角
计算机视觉与模式识别
2022-04-05 v2
摘要
尽管网络设计(基于FCN或基于注意力)和掩码解码策略(基于参数化softmax或基于像素查询)各不相同,但主流的语义分割方案都可以通过将softmax权重或查询向量视为可学习的类别原型而归为同一类。基于这一原型视角,本研究揭示了此类参数化分割范式存在的若干局限,并提出了一种基于不可学习原型的非参数化替代方案。先前的方法以完全参数化的方式为每个类别学习单一的权重/查询向量,而我们的模型将每个类别表示为一组不可学习原型,仅依赖于该类内若干训练像素的均值特征。因此,密集预测通过非参数的最近原型检索实现。这使得我们的模型能够通过优化嵌入像素与锚定原型之间的排布,直接塑造像素嵌入空间。它能够在可学习参数数量恒定的情况下处理任意数量的类别。我们通过实验表明,在基于FCN和基于注意力的分割模型(即HRNet、Swin、SegFormer)以及骨干网络(即ResNet、HRNet、Swin、MiT)上,我们的非参数化框架在多个数据集(即ADE20K、Cityscapes、COCO-Stuff)上取得了引人注目的结果,并在大词汇量场景下表现良好。我们希望这项工作能引发对当前事实标准语义分割模型设计的重新思考。
引用
@article{arxiv.2203.15102,
title = {Rethinking Semantic Segmentation: A Prototype View},
author = {Tianfei Zhou and Wenguan Wang and Ender Konukoglu and Luc Van Gool},
journal= {arXiv preprint arXiv:2203.15102},
year = {2022}
}
备注
Accepted to CVPR 2022 (Oral); Code: https://github.com/tfzhou/ProtoSeg