中文

深入探究形状感知的零样本语义分割

计算机视觉与模式识别 2023-04-18 v1

摘要

得益于大规模视觉-语言预训练的显著进展,近期的识别模型能够以零样本和开放集方式对任意物体进行分类,且准确率惊人地高。然而,将这一成功迁移到语义分割并非易事,因为这一密集预测任务不仅需要准确的语义理解,还需要精细的形状描绘,而现有视觉-语言模型是用图像级语言描述训练的。为弥合这一差距,我们在本研究中追求\textbf{形状感知}的零样本语义分割。受图像分割文献中经典谱方法的启发,我们提出利用由自监督像素级特征构建的拉普拉斯矩阵的特征向量来提升形状感知。尽管这一简单有效的技术完全未使用所见类别的掩码,我们仍证明它优于一种在训练期间对齐真值边缘与预测边缘的最先进形状感知公式。我们还深入探究了在不同数据集上使用不同骨干网络所取得的性能增益,并得出若干有趣且确凿的观察:提升形状感知的益处与掩码紧凑度及语言嵌入局部性高度相关。最后,我们的方法在Pascal和COCO上以显著优势刷新了零样本语义分割的最先进性能。代码与模型见 https://github.com/Liuxinyv/SAZS。

关键词

引用

@article{arxiv.2304.08491,
  title  = {Delving into Shape-aware Zero-shot Semantic Segmentation},
  author = {Xinyu Liu and Beiwen Tian and Zhen Wang and Rui Wang and Kehua Sheng and Bo Zhang and Hao Zhao and Guyue Zhou},
  journal= {arXiv preprint arXiv:2304.08491},
  year   = {2023}
}

备注

Accepted to CVPR 2023, code: https://github.com/Liuxinyv/SAZS