中文

基于大型多模态模型的指令引导的多粒度分割与描述

计算机视觉与模式识别 2024-09-23 v1

摘要

大型多模态模型(LMM)通过扩展大型语言模型取得了显著进展。基于这些进展,最新LMM的发展显示出通过集成分割模型,能够生成密集的像素级分割。尽管具有创新性,但现有工作的文本响应和分割掩码仅位于实例级别,无法在提供详细文本提示的情况下进行细粒度的理解和分割。为克服这一限制,我们引入了多粒度大型多模态模型(MGLMM),其能够根据用户指令无缝调整分割和描述(SegCap)的粒度,从粗粒度到细粒度。我们将这种新任务称为多粒度分割和描述(MGSC)。鉴于MGSC任务缺乏用于模型训练和评估的基准数据集,我们使用定制的自动注释管道建立了一个包含10K张图片和30K多个图像-问题对的基准数据集。我们将在后续研究中发布该数据集及其自动数据集注释管道的实现。此外,我们提出了一种新型统一SegCap数据格式,以统一异构分割数据集;这有效地促进了在多任务训练期间将对象概念与视觉特征关联的学习。大量实验表明,MGLMM在处理超过八个下游任务方面表现卓越,并在MGSC、GCG、图像描述、指代分割、多目标和空分割以及推理分割任务中实现最先进的性能。MGLMM的卓越性能和多功能性凸显了其在推动多模态研究方面的潜在影响。

关键词

引用

@article{arxiv.2409.13407,
  title  = {Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model},
  author = {Li Zhou and Xu Yuan and Zenghui Sun and Zikun Zhou and Jingsong Lan},
  journal= {arXiv preprint arXiv:2409.13407},
  year   = {2024}
}

备注

Code and dataset will be released at https://github.com/lizhou-cs/mglmm. 7 pages, 4 figures with Supplementary Material