搭建视觉与语言理解在广义零样本语义分割之间的桥梁
计算机视觉与模式识别
2025-04-01 v1
摘要
广义零样本语义分割(GZS3)旨在通过引入语义表示(如词向量)的桥梁,实现对不仅限于已见类别,还能对训练数据中未出现的新类别区域进行人类水平的分割。虽然此方法有效,但仅利用一种语义表示来关联相应类别,并以实现从已见类别向未见类别知识迁移的方式,仍不足以与人类认知相符。鼓励的是,人类常常利用“部件”和“状态”信息来理解已见对象并想象未见类别,因此我们将每个类别解耦为包含对象部件和状态的详细描述。基于解耦公式,我们提出了一种解耦式视觉-语言匹配(DeVLMatch)框架,用于GZS3,由空间部件匹配(SPMatch)和通道状态匹配(CSMatch)两个模块组成。在SPMatch中,我们从视觉和语言两个角度理解对象,利用空间部件信息,并进行图匹配以搭建鸿沟。在CSMatch中,来自语言角度的物体状态与来自视觉角度的兼容通道信息进行匹配。通过在视觉和语言理解之间进行解耦和匹配,我们能够在对象部件和状态水平上显式地洞察已见类别与未见类别之间的关系,从而促进了视觉空间中从已见类别向未见类别的知识迁移。该提出的DeVLMatch框架在包括PASCAL VOC、COCO-Stuff和CATARACTS在内的标准基准测试上超越了之前的GZS3方法,展示了其有效性。
引用
@article{arxiv.2503.23806,
title = {Bridge the Gap Between Visual and Linguistic Comprehension for Generalized Zero-shot Semantic Segmentation},
author = {Xiaoqing Guo and Wuyang Li and Yixuan Yuan},
journal= {arXiv preprint arXiv:2503.23806},
year = {2025}
}