中文

Detect2Interact:利用 LLM 在视觉问答 (VQA) 中定位对象关键字段

计算机视觉与模式识别 2024-04-02 v1

摘要

定位在增强 VQA 系统的实用性和精度方面起着至关重要的作用。通过实现对对象特定部分的细粒度识别与交互,它显著提升了系统提供语境相关且空间准确响应的能力,这对于机器人和增强现实等动态环境中的应用至关重要。然而,传统系统在准确映射图像中的对象以生成细致且具有空间感知的响应方面面临挑战。在本工作中,我们引入了“Detect2Interact”,通过引入一种用于细粒度对象视觉关键字段检测的先进方法来解决这些挑战。首先,我们使用分割一切模型 (SAM) 生成图像中对象的详细空间映射图。接下来,我们使用 Vision Studio 提取语义对象描述。第三,我们利用 GPT-4 的常识知识,弥合对象语义与其空间映射图之间的差距。因此,Detect2Interact 在大量测试用例中的对象关键字段检测上取得了一致的定性结果,并通过提供更合理、更精细的视觉表示,超越了带有对象检测的现有 VQA 系统。

关键词

引用

@article{arxiv.2404.01151,
  title  = {Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs},
  author = {Jialou Wang and Manli Zhu and Yulei Li and Honglei Li and Longzhi Yang and Wai Lok Woo},
  journal= {arXiv preprint arXiv:2404.01151},
  year   = {2024}
}

备注

Accepted to IEEE Intelligent Systems