中文

RSVP:基于视觉提示和多模态链思的推理分割

计算机视觉与模式识别 2025-06-06 v1 人工智能

摘要

多模态大语言模型(MLLM)已展现出卓越的推理能力,但缺乏显式的视觉 grounding 与分割机制,导致认知推理与视觉感知之间存在鸿沟。为弥合这一差距,我们提出了推理分割通过视觉提示(Reasoning Segmentation via Visual Prompting,RSVP),一种新型框架,将多步骤多模态推理与 grounded 视觉理解统一。RSVP 是一个两阶段结构化框架,集成推理驱动的局部化与分割细化。在推理阶段,RSVP 采用多模态链思(chain-of-thought)视觉提示帮助 MLLM 理解查询并推断目标,生成可解释的区域提议,以增强视觉 grounding。在分割阶段,RSVP 通过视觉语言分割模块(Vision-Language Segmentation Module,VLSM)细化这些提议,将文本与视觉线索无缝集成,生成精确的分割掩码。通过显式建模多模态推理与分割之间的交互,RSVP 引入了一种可解释推理分割的新范式。它利用 MLLM 固有的局部化能力,使模型不仅能推理对象,还能生成结构化的视觉表征。我们的广泛实验表明,RSVP 在 ReasonSeg 上实现了最先进的性能,相较于最先进方法在 gIoU 上提升最高可达 +6.5,在 cIoU 上提升最高可达 +9.2;在 SegInW 上实现 49.7 mAP。这些结果验证了 RSVP 作为集成认知推理与结构化视觉理解的有效且可扩展框架。

关键词

引用

@article{arxiv.2506.04277,
  title  = {RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought},
  author = {Yi Lu and Jiawang Cao and Yongliang Wu and Bozheng Li and Licheng Tang and Yangguang Ji and Chong Wu and Jay Wu and Wenbo Zhu},
  journal= {arXiv preprint arXiv:2506.04277},
  year   = {2025}
}

备注

Accepted as ACL 2025 Main