中文

VSP:评估视觉规划中感知与推理双重挑战

计算与语言 2024-07-03 v1

摘要

视觉语言模型 (VLM) 是一种新兴的语言模型 (LM) 类,融合了经典 LM 能力与图像处理系统的能力。然而,这些能力的组合方式并不总是直观,这值得直接调查。VLM 中一个较少研究的能力是视觉空间规划——即理解视觉场景中物体的空间布局并制定行动计划以实现所需结果。在我们的研究中,我们引入 VSP,一个基准测试,旨在 1) 总体评估这些模型的空间规划能力,以及 2) 将视觉规划任务分解为更细粒度的子任务,包括感知和推理,并衡量 LM 在这些子任务中的能力。我们的评估显示,开源和私有 VLM 均未能为即使是简单的空间规划任务生成有效计划。对细粒度分析任务的评估进一步揭示了模型在视觉感知和推理能力中的根本性缺陷,解释了其在一般空间规划任务中表现较差的原因。我们的工作阐明了改善 VLM 在空间规划方面能力的未来方向。我们的基准测试已公开于 https://github.com/UCSB-NLP-Chang/Visual-Spatial-Planning。

关键词

引用

@article{arxiv.2407.01863,
  title  = {VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs},
  author = {Qiucheng Wu and Handong Zhao and Michael Saxon and Trung Bui and William Yang Wang and Yang Zhang and Shiyu Chang},
  journal= {arXiv preprint arXiv:2407.01863},
  year   = {2024}
}