中文

多模态参考视觉 grounding

计算机视觉与模式识别 2025-09-25 v2 机器学习

摘要

视觉 grounding focuses 检测基于语言表达式从图像中检测对象。最近的大型视觉语言模型(LVLMs)通过训练大规模数据集显著提升了视觉 grounding performance。然而,尤其是在相似对象出现于输入图像中时,问题仍然具有挑战性。例如,LVM可能无法区分图像中的 Diet Coke 和 regular Coke。在这种情况下,如果可获得 Diet Coke 和 regular Coke 的额外参考图像,则有助于类似对象的视觉 grounding。本 work 引入了一个名为多模态参考视觉 grounding(MRVG)的新任务。在该任务中,模型可访问数据库中对象的参考图像集合。基于这些参考图像和语言表达式,模型需要从 query 图像中检测目标对象。我们首先引入一个新数据集来研究MRVG问题。随后,我们引入一种新方法,称为MRVG-Net,来解决这个视觉 grounding问题。我们展示,通过高效利用参考图像进行 few-shot 检测和使用大型语言模型(LLMs)进行对象匹配,我们的方法在Qwen2.5-VL-72B等最先进LVLMs之上实现了优异的视觉 grounding performance。我们的 approach 桥接了 few-shot 检测和视觉 grounding之间的差距,为视觉理解开辟了新的能力,具有广泛的机器人应用前景。项目页面附有视频、代码和数据集:https://irvlutd.github.io/MultiGrounding

关键词

引用

@article{arxiv.2504.02876,
  title  = {Multimodal Reference Visual Grounding},
  author = {Yangxiao Lu and Ruosen Li and Liqiang Jing and Jikai Wang and Xinya Du and Yunhui Guo and Nicholas Ruozzi and Yu Xiang},
  journal= {arXiv preprint arXiv:2504.02876},
  year   = {2025}
}

备注

Project page with our code and dataset: https://irvlutd.github.io/MultiGrounding