Spatial-LLaVA: 通过空间指称表达式增强大语言模型的视觉理解能力
机器人学
2025-05-20 v1
摘要
多模态大语言模型(MLLMs)在理解视觉输入和文本输入方面展现出惊人的能力。通常,这些模型是在来自互联网的大量数据上训练的,这些数据足以应对一般任务,如场景理解和问答。然而,它们在数据稀缺的专业任务上常常表现不佳,例如确定对象之间的空间关系或在一组具有相似特征的对象中定位唯一目标对象。针对这一挑战,我们引入了由1号文献引入的 SUN-Spot v2.0 数据集,现总计包含9万张图像-文本对,并附加了对地标对象的额外标注。每个图像-文本对利用 Set-of-Marks 提示作为额外指示器,将图像中每个地标对象映射到文本中提及的相应对象。此外,我们提出了 Spatial-LLaVA,一个在使用 SUNSpot v2.0 数据集生成的对话式数据上训练的 MLLM。我们的方法确保了图像中对象与标题中相应对象提及之间的稳健对齐,使模型能够在无需依赖对象语义信息偏见的情况下学习空间指称表达式。Spatial-LLaVA 在零样本视觉空间推理基准数据集上比以前的方法性能提升了 3.15%。Spatial-LLaVA 专为精确理解空间指称表达式而设计,适用于需要精确对象识别的实际场景任务,如自动导航和交互式机器人。
引用
@article{arxiv.2505.12194,
title = {Spatial-LLaVA: Enhancing Large Language Models with Spatial Referring Expressions for Visual Understanding},
author = {Xuefei Sun and Doncey Albin and Cecilia Mauceri and Dusty Woods and Christoffer Heckman},
journal= {arXiv preprint arXiv:2505.12194},
year = {2025}
}