中文

LLaVA-Grounding:基于大型多模态模型的接地视觉聊天

计算机视觉与模式识别 2023-12-06 v1

摘要

随着大型多模态模型(LMMs)近期取得显著进展,其在视觉聊天中的接地能力的重要性日益受到认可。尽管近期努力使 LMMs 支持接地,但其接地与聊天能力通常是分离的,且在被要求进行接地时其聊天性能急剧下降。问题在于缺乏用于接地视觉聊天(GVC)的数据集。现有的接地区数据集仅包含简短描述。为解决这一问题,我们创建了允许结合接地与聊天能力的 GVC 数据。为了更好地评估 GVC 能力,我们引入了一个名为 Grounding-Bench 的基准。此外,我们提出了一种模型设计,通过将分割模型与语言模型相连接,能够支持 GVC 和各种类型的视觉提示。实验结果表明,我们的模型在 Grounding-Bench 上优于其他 LMMs。此外,我们的模型在 RefCOCO/+/g 和 Flickr30K Entities 等经典接地区基准上取得了具有竞争力的性能。我们的代码将发布于 https://github.com/UX-Decoder/LLaVA-Grounding 。

关键词

引用

@article{arxiv.2312.02949,
  title  = {LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models},
  author = {Hao Zhang and Hongyang Li and Feng Li and Tianhe Ren and Xueyan Zou and Shilong Liu and Shijia Huang and Jianfeng Gao and Lei Zhang and Chunyuan Li and Jianwei Yang},
  journal= {arXiv preprint arXiv:2312.02949},
  year   = {2023}
}