中文

GSVA: 基于多模态大语言模型的广义分割

计算机视觉与模式识别 2024-03-22 v3

摘要

广义指代表达分割(GRES)将经典RES的范围扩展到在一个表达中引用多个对象或识别图像中不存在的空目标。GRES在建模图像中实例的复杂空间关系和识别不存在的指代对象方面提出了挑战。多模态大语言模型(MLLMs)最近在这些复杂的视觉-语言任务中显示出巨大进展。通过连接大语言模型(LLMs)和视觉模型,MLLMs擅长理解带有视觉输入的上下文。其中,LISA作为代表,采用特殊的[SEG]标记来提示分割掩码解码器(例如SAM),使MLLMs能够执行RES任务。然而,现有的GRES解决方案仍然不令人满意,因为当前的分割MLLMs无法正确处理用户可能在单个提示中引用多个主题或提供与任何图像目标不一致的描述的情况。在本文中,我们提出了广义分割视觉助手(GSVA)来解决这一差距。具体来说,GSVA重用[SEG]标记来提示分割模型同时支持多个掩码引用,并创新地学习生成[REJ]标记以明确拒绝空目标。实验验证了GSVA在解决GRES问题上的有效性,标志着显著增强并在GRES基准gRefCOCO数据集上创造了新记录。GSVA在各种经典指代分割和理解任务中也证明了有效性。

关键词

引用

@article{arxiv.2312.10103,
  title  = {GSVA: Generalized Segmentation via Multimodal Large Language Models},
  author = {Zhuofan Xia and Dongchen Han and Yizeng Han and Xuran Pan and Shiji Song and Gao Huang},
  journal= {arXiv preprint arXiv:2312.10103},
  year   = {2024}
}

备注

Accepted by CVPR2024 (19 pages, 9 figures, 11 tables)