中文

ExpVG:探索多模态大语言模型中视觉 grounding 设计空间

计算机视觉与模式识别 2025-08-21 v2 人工智能 计算与语言 机器学习

摘要

多模态大语言模型(MLLMs)中的精细化多模态能力已成为解决视觉 grounding(VG)问题的关键研究方向。尽管现有方法取得了强大的性能,但它们经常在为MLLMs进行VG微调时采用不同的设计选择,缺乏对这些设计的系统性验证以支持。为填补这一差距,本文提出了对各种影响MLLMs VG性能的设计选择进行的全面研究。我们使用LLaVA-1.5进行分析,因为它在MLLMs的先前实证研究中被广泛采用。尽管更近期的模型存在,但我们遵循这一惯例以确保我们的发现对其他架构保持广泛适用性和可扩展性。我们涵盖两个关键方面:(1)探索MLLMs中不同的视觉 grounding范式,识别最有效的设计,并提供我们的见解;(2)对grounding数据的设计进行消融研究,以优化MLLMs在VG任务上的微调。最后,我们的发现为VG提供了更强大的MLLMs,在RefCOCO/+/g上实现了+5.6%/+6.9%/+7.0%的提升。

关键词

引用

@article{arxiv.2508.08066,
  title  = {ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model},
  author = {Weitai Kang and Weiming Zhuang and Zhizhong Li and Yan Yan and Lingjuan Lyu},
  journal= {arXiv preprint arXiv:2508.08066},
  year   = {2025}
}

备注

8 pages for the main paper