NuScenes-SpatialQA:面向自动驾驶中视觉语言模型的空间理解与推理基准
计算机视觉与模式识别
2025-04-08 v2 人工智能
摘要
近期视觉语言模型(VLM)的进展在自动驾驶任务中展现出强大潜力。然而,其空间理解与推理能力——自动驾驶的关键能力——仍表现出显著局限性。值得注意的是,现有基准均未系统评估VLM在驾驶场景中的空间推理能力。为填补这一空白,我们提出NuScenes-SpatialQA,这是首个专门用于评估自动驾驶中VLM空间理解与推理能力的大规模基于真实标注的问答(QA)基准。该基准基于NuScenes数据集,通过自动化3D场景图生成流程和QA生成流程构建。该基准从多个维度系统评估VLM在空间理解和推理方面的性能。利用该基准,我们对多种VLM(包括通用模型和空间增强模型)进行了大量实验,首次全面评估了它们在自动驾驶中的空间能力。令人惊讶的是,实验结果表明,空间增强VLM在定性QA中表现更优,但在定量QA中并未展现出竞争力。总体而言,VLM在空间理解和推理方面仍面临相当大的挑战。
引用
@article{arxiv.2504.03164,
title = {NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving},
author = {Kexin Tian and Jingrui Mao and Yunlong Zhang and Jiwan Jiang and Yang Zhou and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2504.03164},
year = {2025}
}