中文

VisionGraph:利用大型多模态模型解决视觉语境中的图论问题

计算机视觉与模式识别 2024-05-09 v1 人工智能 计算与语言

摘要

大型多模态模型(Large Multimodal Models, LMMs)在视觉理解与推理方面取得了显著成功,极大地提升了视觉语境下数学推理的性能。然而,一类具有挑战性的视觉数学问题在于多模态图论问题,这要求 LMMs 准确理解图结构并在视觉图上执行多步推理。此外,探索多模态图论问题将有助于在生物学、交通运输和机器人规划等领域发展更有效的策略。为推进该方向的研究,我们首个设计了名为 VisionGraph 的基准,用于探索先进 LMMs 解决多模态图论问题的能力。它涵盖了从连通性问题到最短路径问题等八项复杂图问题任务。随后,我们提出了描述-程序-推理(Description-Program-Reasoning, DPR)链,通过图结构描述生成与算法感知的多步推理来增强推理过程的逻辑准确性。我们的广泛研究表明:1)在多步图推理中,GPT-4V 优于 Gemini Pro;2)无论在零样本/少样本设置还是在有监督微调(SFT)下,所有 LMMs 对图结构的感知准确率均较低,这进一步影响了问题求解性能;3)DPR 显著提升了 LMMs 的多步图推理能力,且 GPT-4V (DPR) 智能体取得了 SOTA 性能。

关键词

引用

@article{arxiv.2405.04950,
  title  = {VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context},
  author = {Yunxin Li and Baotian Hu and Haoyuan Shi and Wei Wang and Longyue Wang and Min Zhang},
  journal= {arXiv preprint arXiv:2405.04950},
  year   = {2024}
}

备注

17 pages; Accepted by ICML 2024