中文

面向零样本语义分割的语言驱动视觉共识

计算机视觉与模式识别 2024-03-14 v1 人工智能

摘要

以 CLIP 为代表的预训练视觉-语言模型,通过 Transformer 解码器将视觉特征与类别嵌入对齐以生成语义掩码,推动了零样本语义分割的发展。尽管该方法有效,但此范式下的主流方法仍面临挑战,包括对已见类别的过拟合以及掩码中的小碎片化问题。为缓解这些问题,我们提出了一种语言驱动视觉共识(LDVC)方法,旨在促进语义与视觉信息的更好对齐。具体而言,我们利用类别嵌入作为锚点,因其具有离散和抽象的特性,引导视觉特征向类别嵌入靠拢。此外,为避免视觉部分因其冗余特性而产生噪声对齐,我们在自注意力机制中引入路由注意力(route attention)以寻找视觉共识,从而增强同一对象内的语义一致性。结合视觉-语言提示策略,我们的方法显著提升了分割模型对未见类别的泛化能力。实验结果证明了我们方法的有效性,与最先进的方法相比,在 PASCAL VOC 2012 和 COCO-Stuff 164k 数据集上,未见类别的 mIoU 分别提升了 4.5 和 3.6。

关键词

引用

@article{arxiv.2403.08426,
  title  = {Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation},
  author = {Zicheng Zhang and Tong Zhang and Yi Zhu and Jianzhuang Liu and Xiaodan Liang and QiXiang Ye and Wei Ke},
  journal= {arXiv preprint arXiv:2403.08426},
  year   = {2024}
}