中文

Ground-V:教导视觉语言模型在像素层面处理复杂指令

计算机视觉与模式识别 2025-05-21 v1

摘要

本工作提出一种简洁且有效的工作流程,用于自动扩展遵循指令的数据,以激发视觉语言模型(VLM)在复杂指令下的像素级 grounding 能力。具体而言,我们针对文本指令基于 grounding 面临的五个关键现实挑战:幻觉引用、多目标情景、推理、多层次以及部件级引用。通过从预训练教师模型进行知识蒸馏,我们的方法生成与现有像素级标注关联的高质量指令-响应对,大幅降低对昂贵人工标注的需求。生成的数据集Ground-V捕获了丰富的对象定位知识和细腻的像素级指代表达。实验结果表明,在Ground-V上训练的模型在多样化的 grounding 任务上实现显著提升。具体而言,在训练期间纳入Ground-V可直接实现LISA和PSALM上六个基准测试中gIoU指标平均提升4.4%和7.9%。该方法还在诸多标准基准测试上取得新纪录,如RefCOCO/+/g。值得注意的是,在gRefCOCO上,我们实现N-Acc为83.3%,超越前一水平组塞尔(SOTA)超过20%。

关键词

引用

@article{arxiv.2505.13788,
  title  = {Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels},
  author = {Yongshuo Zong and Qin Zhang and Dongsheng An and Zhihua Li and Xiang Xu and Linghan Xu and Zhuowen Tu and Yifan Xing and Onkar Dabeer},
  journal= {arXiv preprint arXiv:2505.13788},
  year   = {2025}
}

备注

Accepted to CVPR'25