中文

SED:一种用于开放词汇语义分割的简单编码器-解码器

计算机视觉与模式识别 2024-02-28 v2

摘要

开放词汇语义分割旨在将像素从开放类别集合中区分到不同的语义组中。大多数现有方法探索利用预训练的视觉-语言模型,其中关键是将图像级模型用于像素级分割任务。本文提出一种简单的编码器-解码器,称为SED,用于开放词汇语义分割,其包含基于分层编码器的代价图生成和带有类别早期拒绝的渐进融合解码器。基于分层编码器的代价图生成采用分层主干网络而非普通Transformer来预测像素级图像-文本代价图。与普通Transformer相比,分层主干网络能更好地捕获局部空间信息,并且相对于输入尺寸具有线性计算复杂度。我们的渐进融合解码器采用自顶向下结构,将代价图与不同主干网络层级的特征图结合以进行分割。为加速推理速度,我们在解码器中引入类别早期拒绝方案,在解码器早期层拒绝许多不存在的类别,从而实现至多4.7倍加速且无精度下降。在多个开放词汇语义分割数据集上进行了实验,证明了我们SED方法的有效性。当使用ConvNeXt-B时,我们的SED方法在ADE20K上以150个类别取得31.6%的mIoU分数,在单张A6000上每张图像耗时82毫秒(msms)。我们将在\url{https://github.com/xb534/SED.git}发布代码。

关键词

引用

@article{arxiv.2311.15537,
  title  = {SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation},
  author = {Bin Xie and Jiale Cao and Jin Xie and Fahad Shahbaz Khan and Yanwei Pang},
  journal= {arXiv preprint arXiv:2311.15537},
  year   = {2024}
}

备注

Accepted by CVPR2024