基于语义辅助校准的开放词汇分割
计算机视觉与模式识别
2024-11-27 v2
摘要
本文通过利用CLIP的广义上下文先验校准词汇内和领域有偏的嵌入空间,研究开放词汇分割(OVS)。作为开放词汇理解的核心,视觉内容与无界文本语义的对齐已成为该领域的瓶颈。为应对这一挑战,近期工作提出利用CLIP作为额外分类器,并将模型预测与CLIP分类结果聚合。尽管取得了显著进展,但在相关场景中OVS方法的性能仍不如有监督方法。我们将其归因于词汇内嵌入和领域有偏的CLIP预测。为此,我们提出了一种语义辅助校准网络(SCAN)。在SCAN中,我们将CLIP的广义语义先验融入提议嵌入,以避免在已知类别上坍缩。此外,应用上下文移位策略来缓解全局上下文缺失和异常背景噪声。通过上述设计,SCAN在所有流行的开放词汇分割基准上达到了最先进的性能。此外,我们还关注现有评估系统中忽略类别间语义重复的问题,并提出了一种新的度量标准,称为语义引导IoU(SG-IoU)。
引用
@article{arxiv.2312.04089,
title = {Open-Vocabulary Segmentation with Semantic-Assisted Calibration},
author = {Yong Liu and Sule Bai and Guanbin Li and Yitong Wang and Yansong Tang},
journal= {arXiv preprint arXiv:2312.04089},
year = {2024}
}
备注
Accepted by CVPR2024