中文

重写描述语义:弥合语言监督语义分割中的语义鸿沟

计算机视觉与模式识别 2024-01-05 v4

摘要

视觉-语言预训练已展现出卓越的零样本识别能力,以及从语言监督中学习可泛化视觉表示的潜力。更进一步,语言监督语义分割通过仅从图像-文本对中学习像素分组,实现对文本输入的空间定位。然而,最先进方法存在视觉与文本模态间明显的语义鸿沟:图像中出现的大量视觉概念在其配对描述中缺失。此类语义错位在预训练中循环,导致因文本表示捕获的视觉概念不足而引起密集预测零样本性能欠佳。为缩小该语义鸿沟,我们提出概念整理(CoCu),一种利用CLIP补偿缺失语义的流程。对于每个图像-文本对,我们建立概念档案,通过所提视觉驱动扩展与文本到视觉引导排序维护潜在视觉匹配概念。相关概念可经簇引导采样识别并送入预训练,从而弥合视觉与文本语义间的鸿沟。在8个分割基准广泛套件上的大量实验表明,CoCu取得优异零样本迁移性能,并大幅提振语言监督分割基线,暗示了在预训练数据中弥合语义鸿沟的价值。

关键词

引用

@article{arxiv.2309.13505,
  title  = {Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation},
  author = {Yun Xing and Jian Kang and Aoran Xiao and Jiahao Nie and Ling Shao and Shijian Lu},
  journal= {arXiv preprint arXiv:2309.13505},
  year   = {2024}
}

备注

NeurIPS 2023. Code is available at https://github.com/xing0047/rewrite