SURDS:利用视觉语言模型对驾驶场景中的空间理解与推理进行基准测试
计算机视觉与模式识别
2025-05-28 v3
摘要
在户外环境中准确的空间推理——涵盖几何、物体姿态及物体间关系——对于自动驾驶中的建图、运动预测和高层规划等下游任务至关重要。我们引入了 SURDS,这是一个旨在系统评估视觉语言模型(VLM)空间推理能力的大规模基准。SURDS 基于 nuScenes 数据集构建,包含 41,080 个视觉问答训练实例和 9,250 个评估样本,涵盖六个空间类别:朝向、深度估计、像素级定位、成对距离、横向排序及前后关系。我们对包括 GPT、Gemini 和 Qwen 在内的领先通用 VLM 进行了基准测试,揭示了其在细粒度空间理解方面持续存在的局限性。为解决这些不足,我们超越了静态评估,探索对齐技术能否提升空间推理性能。具体而言,我们提出了一种基于强化学习的对齐方案,利用空间基础奖励信号——同时捕捉感知级准确性(位置)和推理一致性(逻辑)。我们进一步引入最终答案正确性和输出格式奖励,以指导细粒度的策略适应。我们的 GRPO 对齐变体在 SURDS 基准测试中取得了 40.80 的总分。值得注意的是,它优于 GPT-4o(13.30)和 Gemini-2.0-flash(35.71)等专有系统。据我们所知,这是首项证明基于强化学习的对齐能够显著且一致地增强 VLM 在真实驾驶场景中空间推理能力的研究。我们通过以下链接发布了 SURDS 基准、评估工具包和 GRPO 对齐代码:https://github.com/XiandaGuo/Drive-MLLM。
引用
@article{arxiv.2411.13112,
title = {SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models},
author = {Xianda Guo and Ruijun Zhang and Yiqun Duan and Yuhang He and Dujun Nie and Wenke Huang and Chenming Zhang and Shuai Liu and Hao Zhao and Long Chen},
journal= {arXiv preprint arXiv:2411.13112},
year = {2025}
}