利用句子嵌入扩展多域语义分割
计算机视觉与模式识别
2024-05-01 v2
摘要
我们提出一种语义分割方法,在零样本设置下应用时达到了最先进的监督性能。因此,它在每个主要语义分割数据集上均取得了与监督方法相当的结果,而无需在这些数据集上训练。这是通过将每个类别标签替换为描述该类别的短段落的向量值嵌入来实现的。该方法的通用性和简洁性使得能够合并来自不同领域的多个数据集,每个数据集具有变化的类别标签和语义。由此产生的超过200万张图像的合并语义分割数据集使得可以训练一个模型,该模型在7个基准数据集上取得了与最先进监督方法相当的性能,尽管未使用其中的任何图像。通过在标准语义分割数据集上微调该模型,我们还在NYUD-V2和PASCAL-context上分别以60%和65%的mIoU实现了对最先进监督分割的显著提升。基于语言嵌入的相近性,我们的方法甚至能分割未见过的标签。大量实验展示了对未见图像域和未见标签的强泛化能力,并且该方法在包括深度估计和实例分割在内的下游应用中实现了令人印象深刻的性能提升。
引用
@article{arxiv.2202.02002,
title = {Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings},
author = {Wei Yin and Yifan Liu and Chunhua Shen and Baichuan Sun and Anton van den Hengel},
journal= {arXiv preprint arXiv:2202.02002},
year = {2024}
}
备注
14 pages. Accepted to Int. J. Comp. Vis. (IJCV)