中文

GROUNDHOG:将大型语言模型落地至整体分割

计算机视觉与模式识别 2024-04-17 v2 人工智能 计算与语言

摘要

大多数多模态大型语言模型(MLLMs)通过因果语言建模学习语言到物体的落地(grounding),其中落地的物体由作为位置标记序列的边界框捕获。这种范式缺乏对细粒度视觉理解和诊断至关重要的像素级表示。在这项工作中,我们介绍了 GROUNDHOG,这是一种通过将大型语言模型落地至整体分割而开发的 MLLM。GROUNDHOG 结合了一个掩码特征提取器,并将提取的特征转换为 MLLM 主干的视觉实体标记,随后通过检索和合并实体掩码,将可落地的短语连接到统一的落地掩码。为了训练 GROUNDHOG,我们精心构建了 M3G2,这是一个具有多模态多粒度落地(Multi-Modal Multi-Grained Grounding)的落地视觉指令微调数据集,该数据集通过收集具有丰富标注的分割落地数据集而成。我们的实验结果表明,GROUNDHOG 在各种语言落地任务中实现了卓越的性能,且无需特定任务的微调,并显著减少了物体幻觉。GROUNDHOG 还展示了对复杂形式视觉输入更好的落地能力,并在失败案例中提供了易于理解的诊断。

关键词

引用

@article{arxiv.2402.16846,
  title  = {GROUNDHOG: Grounding Large Language Models to Holistic Segmentation},
  author = {Yichi Zhang and Ziqiao Ma and Xiaofeng Gao and Suhaila Shakiah and Qiaozi Gao and Joyce Chai},
  journal= {arXiv preprint arXiv:2402.16846},
  year   = {2024}
}

备注

Accepted to CVPR 2024. Website: https://groundhog-mllm.github.io/