面向指涉图像分割的渐进式提示引导的跨模态推理
计算机视觉与模式识别
2026-03-31 v1
摘要
指涉图像分割旨在基于自由形式的指涉表达式局部和分割图像中的目标对象。核心挑战在于有效地将语言描述与对象级视觉表征建立联系,尤其当指涉表达式涉及详细属性和复杂对象间关系时。现有方法要么依赖跨模态对齐,要么采用语义分割提示,但往往缺乏对语言描述与图像中目标区域 grounding 的明确推理机制。为此,我们提出PPCR(Progressive Prompt-guided Cross-modal Reasoning),即渐进式提示引导的跨模态推理框架,用于指涉图像分割。PPCR将推理过程明确结构化为语义理解-空间定位-实例分割三个阶段。具体而言,PPCR首先利用多模态大型语言模型(MLLM)生成捕获目标对象关键语义线索的语义分割提示。基于此语义上下文,进一步生成空间分割提示,用于推理对象位置和空间范围,实现从语义理解向空间定位的渐进过渡。随后,将语义和空间分割提示联合集成到分割模块中,以引导精确的目标定位和分割。大量实验表明,PPCR在标准指涉图像分割基准测试上 consistently优于现有方法。该代码将公开 release 以促进可重复性。
引用
@article{arxiv.2603.27993,
title = {Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation},
author = {Jiachen Li and Hongyun Wang and Jinyu Xu and Wenbo Jiang and Yanchun Ma and Yongjian Liu and Qing Xie and Bolong Zheng},
journal= {arXiv preprint arXiv:2603.27993},
year = {2026}
}