中文

Pink:揭示多模态大语言模型指代表达理解的能力

计算机视觉与模式识别 2024-03-14 v3 人工智能

摘要

多模态大语言模型(MLLMs)在各种多模态任务中展现出卓越的能力。然而,它们在细粒度图像理解任务上的性能仍然有限。为解决此问题,本文提出一种新的框架以增强 MLLMs 的细粒度图像理解能力。具体而言,我们提出了一种利用现有数据集中的标注以低成本构建指令微调数据集的新方法。还引入了一种自一致引导方法,将现有的密集目标标注扩展为高质量的指代表达-边界框对。这些方法能够生成包含细粒度图像感知所需的一系列基础能力的高质量指令数据。此外,我们认为在指令微调过程中应对视觉编码器进行调优,以缓解全图感知与细粒度图像感知之间的差距。实验结果表明了我们方法的优越性能。例如,我们的模型在 GQA 上比 Qwen-VL 准确率提升 5.2%,并在 RefCOCO_val 上超越 Kosmos-2 准确率 24.7%。我们还在 MMBench 的排行榜上取得了第一名。这一令人鼓舞的性能仅通过在公开可用数据上训练即可实现,易于复现。模型、数据集与代码已公开于 https://github.com/SY-Xuan/Pink。

关键词

引用

@article{arxiv.2310.00582,
  title  = {Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs},
  author = {Shiyu Xuan and Qingpei Guo and Ming Yang and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2310.00582},
  year   = {2024}
}