中文

用于零样本全景分割与语义分割的可泛化语义视觉查询生成

计算机视觉与模式识别 2024-02-22 v1

摘要

零样本全景分割(ZPS)旨在训练中不包含未见类别图像的情况下,识别前景实例和背景类别。由于视觉数据稀疏以及从已见类别泛化到未见类别的困难,该任务仍具挑战性。为了更好地泛化到未见类别,我们提出了条件 token 对齐与循环转换(Conditional tOken aligNment and Cycle trAnsiTion,CONCAT),以生成可泛化的语义视觉查询。首先,通过 CON 训练特征提取器以连接视觉和语义,从而提供目标查询。形式上,CON 被提出用于将语义查询与从完整图像和掩码图像中提取的 CLIP 视觉 CLS token 进行对齐。为了解决未见类别缺失的问题,需要一个生成器。然而,合成伪视觉查询(即未见类别的视觉查询)的差距之一是通过语义嵌入描述细粒度的视觉细节。因此,我们采用 CAT 以语义-视觉和视觉-语义的方式训练生成器。在语义-视觉中,提出视觉查询对比,通过将包含片段的伪视觉查询拉向相应目标,同时将不包含片段的查询推远,以建模视觉的高粒度。为确保生成的查询保留语义信息,在视觉-语义中,伪视觉查询被映射回语义并由真实语义嵌入监督。在 ZPS 上的实验实现了 5.2% 的 hPQ 提升,超越了 SOTA。我们还考察了归纳式 ZPS 和开放词汇语义分割,并获得了可比的结果,同时测试速度快了 2 倍。

关键词

引用

@article{arxiv.2402.13697,
  title  = {Generalizable Semantic Vision Query Generation for Zero-shot Panoptic and Semantic Segmentation},
  author = {Jialei Chen and Daisuke Deguchi and Chenkai Zhang and Hiroshi Murase},
  journal= {arXiv preprint arXiv:2402.13697},
  year   = {2024}
}