中文

基于空间与多尺度感知视觉类嵌入的零样本语义分割

计算机视觉与模式识别 2021-12-21 v2

摘要

全监督语义分割技术带来了场景理解的范式转变。然而,昂贵标注成本的负担仍是一项挑战。为解决成本问题,近期研究提出了基于语言模型的零样本语义分割(L-ZSSS)方法。本文中,我们指出 L-ZSSS 在泛化性上存在局限,而泛化性正是零样本学习的优势所在。针对该局限,我们提出了一种无语言模型的零样本语义分割框架——空间与多尺度感知视觉类嵌入网络(SM-VCENet)。此外,SM-VCENet 利用面向视觉的类嵌入,通过多尺度注意力与空间注意力丰富了类嵌入的视觉信息。我们还提出了一个用于零样本语义分割的新基准(PASCAL2COCO),其通过域适应提供泛化性评估并包含视觉上具有挑战性的样本。实验中,我们的 SM-VCENet 在 PASCAL-5i 基准上以相对优势超越零样本语义分割最优方法,并在 PASCAL2COCO 基准上展现出泛化鲁棒性。

关键词

引用

@article{arxiv.2111.15181,
  title  = {Zero-Shot Semantic Segmentation via Spatial and Multi-Scale Aware Visual Class Embedding},
  author = {Sungguk Cha and Yooseung Wang},
  journal= {arXiv preprint arXiv:2111.15181},
  year   = {2021}
}

备注

Under Review on Pattern Recognition Letters