SemiVL:具有视觉-语言引导的半监督语义分割
计算机视觉与模式识别
2023-11-29 v1
摘要
在半监督语义分割中,模型使用有限数量的标注图像以及大量未标注图像进行训练,以减少高昂的标注成本。虽然先前的方法能够学习到良好的分割边界,但由于监督有限,它们容易混淆具有相似视觉外观的类别。另一方面,视觉-语言模型(VLM)能够从图像-描述数据集中学习多样的语义知识,但由于图像级训练而产生噪声分割。在 SemiVL 中,我们提出将 VLM 预训练中的丰富先验整合到半监督语义分割中,以学习更好的语义决策边界。为使 VLM 从全局推理适应到局部推理,我们引入了用于标签高效学习的空间微调策略。此外,我们设计了一个语言引导解码器来联合推理视觉与语言。最后,我们提出通过以类别定义的形式向模型提供语言引导来处理类标签中固有的歧义。我们在 4 个语义分割数据集上评估了 SemiVL,其显著优于先前的半监督方法。例如,SemiVL 在 COCO 上使用 232 张标注图像时将最优性能提升了 +13.5 mIoU,在 Pascal VOC 上使用 92 个标签时提升了 +6.1 mIoU。项目页面:https://github.com/google-research/semivl
引用
@article{arxiv.2311.16241,
title = {SemiVL: Semi-Supervised Semantic Segmentation with Vision-Language Guidance},
author = {Lukas Hoyer and David Joseph Tan and Muhammad Ferjad Naeem and Luc Van Gool and Federico Tombari},
journal= {arXiv preprint arXiv:2311.16241},
year = {2023}
}