中文

所感知即所构想:面向开放词汇图像分割的认知启发框架

计算机视觉与模式识别 2025-05-27 v1

摘要

开放词汇图像分割旨在解决通过视觉-语言对齐,在推理时识别动态可调、预定义新类别的挑战。然而,现有范式通常先进行与类别无关的区域分割,随后进行类别匹配,这偏离了人类视觉系统基于语义概念识别物体的过程,导致区域分割与目标概念之间对齐不佳。为了弥合这一差距,我们提出了一个面向开放词汇图像分割的认知启发框架,该框架模拟人类视觉识别过程:首先形成对物体的概念理解,然后感知其空间范围。该框架由三个核心组件组成:(1)生成式视觉-语言模型(G-VLM),通过生成物体概念来模拟人类认知,为区域分割提供语义指导。(2)概念感知视觉增强模块,将文本概念特征与全局视觉表示相融合,基于目标概念实现自适应视觉感知。(3)认知启发解码器,将局部实例特征与 G-VLM 提供的语义线索相集成,允许对相关类别的子集进行选择性分类。大量实验表明,我们的框架取得了显著改进,在 A-150 上达到 27.227.2 PQ、17.017.0 mAP 和 35.335.3 mIoU。在 Cityscapes、Mapillary Vistas、A-847、PC-59、PC-459 和 PAS-20 上分别进一步达到 56.256.228.228.215.415.459.259.218.718.795.895.8 mIoU。此外,我们的框架支持无词汇分割,在识别未见类别时提供了更高的灵活性。代码将公开。

关键词

引用

@article{arxiv.2505.19569,
  title  = {What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation},
  author = {Jianghang Lin and Yue Hu and Jiangtao Shen and Yunhang Shen and Liujuan Cao and Shengchuan Zhang and Rongrong Ji},
  journal= {arXiv preprint arXiv:2505.19569},
  year   = {2025}
}