GROUNDHOG:将大型语言模型落地至整体分割
计算机视觉与模式识别
2024-04-17 v2 人工智能
计算与语言
摘要
大多数多模态大型语言模型(MLLMs)通过因果语言建模学习语言到物体的落地(grounding),其中落地的物体由作为位置标记序列的边界框捕获。这种范式缺乏对细粒度视觉理解和诊断至关重要的像素级表示。在这项工作中,我们介绍了 GROUNDHOG,这是一种通过将大型语言模型落地至整体分割而开发的 MLLM。GROUNDHOG 结合了一个掩码特征提取器,并将提取的特征转换为 MLLM 主干的视觉实体标记,随后通过检索和合并实体掩码,将可落地的短语连接到统一的落地掩码。为了训练 GROUNDHOG,我们精心构建了 M3G2,这是一个具有多模态多粒度落地(Multi-Modal Multi-Grained Grounding)的落地视觉指令微调数据集,该数据集通过收集具有丰富标注的分割落地数据集而成。我们的实验结果表明,GROUNDHOG 在各种语言落地任务中实现了卓越的性能,且无需特定任务的微调,并显著减少了物体幻觉。GROUNDHOG 还展示了对复杂形式视觉输入更好的落地能力,并在失败案例中提供了易于理解的诊断。
引用
@article{arxiv.2402.16846,
title = {GROUNDHOG: Grounding Large Language Models to Holistic Segmentation},
author = {Yichi Zhang and Ziqiao Ma and Xiaofeng Gao and Suhaila Shakiah and Qiaozi Gao and Joyce Chai},
journal= {arXiv preprint arXiv:2402.16846},
year = {2024}
}
备注
Accepted to CVPR 2024. Website: https://groundhog-mllm.github.io/