中文

Proximity QA:释放多模态大语言模型在空间邻近性分析中的潜力

计算机视觉与模式识别 2024-02-01 v1

摘要

多模态大语言模型(MLLMs)已展现出卓越的视觉-语言能力,这主要归功于大语言模型(LLMs)出色的上下文理解与多任务学习优势。视觉指令微调的出现进一步提升了 MLLMs 在视觉-语言理解上的表现。然而,尽管现有 MLLMs 能熟练识别图像中“有什么”物体,它们在有效辨别这些物体“在哪里”方面仍面临挑战,尤其是在距离(场景深度)维度上。为克服 MLLMs 的这一局限,我们提出了邻近性问答(Proximity QA),一个旨在使 MLLMs 能够推断图像中物体间邻近关系的新颖框架。该框架分两阶段运作:第一阶段侧重于引导模型理解物体的相对深度,第二阶段则进一步鼓励模型基于其深度感知来推断物体间的邻近关系。我们还提出了一个名为 Proximity-110K 的 VQA 数据集,其中包含融合了深度信息与物体邻近关系的额外指令。我们进行了大量实验,验证了 Proximity QA 在深度感知和邻近性分析方面的卓越能力,其性能优于其他最先进的 MLLMs。代码与数据集将发布于 \textcolor{magenta}{https://github.com/NorthSummer/ProximityQA.git}。

关键词

引用

@article{arxiv.2401.17862,
  title  = {Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis},
  author = {Jianing Li and Xi Nan and Ming Lu and Li Du and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2401.17862},
  year   = {2024}
}

备注

15 pages,version 1