中文

Groma:面向多模态大语言模型定位的局部视觉 Token 化

计算机视觉与模式识别 2024-04-22 v1 人工智能 计算与语言 机器学习

摘要

我们引入了 Groma,一种具备定位和细粒度视觉感知能力的多模态大语言模型(MLLM)。除了整体图像理解外,Groma 还擅长区域级任务,如区域描述和视觉定位。这些能力建立在局部视觉 token 化机制之上,其中图像输入被分解为感兴趣区域,随后被编码为区域 token。通过将区域 token 集成到用户指令和模型响应中,我们无缝地使 Groma 能够理解用户指定的区域输入,并将其文本输出定位到图像上。此外,为了增强 Groma 的定位对话能力,我们利用强大的 GPT-4V 和视觉提示技术精心构建了一个视觉定位指令数据集。与依赖语言模型或外部模块进行定位的 MLLM 相比,Groma 在标准指代和定位基准测试中始终表现出卓越的性能,突出了将定位嵌入图像 token 化的优势。项目页面:https://groma-mllm.github.io/。

关键词

引用

@article{arxiv.2404.13013,
  title  = {Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models},
  author = {Chuofan Ma and Yi Jiang and Jiannan Wu and Zehuan Yuan and Xiaojuan Qi},
  journal= {arXiv preprint arXiv:2404.13013},
  year   = {2024}
}