中文

STSBench:面向自动驾驶中多模态大语言模型的时空情景基准

计算机视觉与模式识别 2025-06-09 v1

摘要

我们介绍STSBench,一个用于评估视觉语言模型(VLM)在自动驾驶领域整体理解的情景基准框架。该框架自动从任何数据集中使用 ground-truth 注释挖掘预定义的交通情景,提供直观的用户界面进行高效的人类验证,并生成用于模型评估的多选问题。应用于NuScenes数据集,我们呈现STSnu,这是第一个评估基于全面3D感知的VLM时空推理能力的基准。现有基准通常针对单一视角的图像或视频的即插即用或微调VLM,聚焦于物体识别、密集描述、风险评估或场景理解等语义任务。相比之下,STSnu评估面向端到端驾驶的驾驶专家VLM,基于来自多视角摄像机或LiDAR的视频。它特别评估其关于 ego-vehicle 动作以及交通参与者之间复杂相互作用的推理能力,这是自动驾驶车辆的关键能力。该基准包含43个多样化情景,跨越多个视角和帧, resulting in 971个人类验证的多选问题。全面评估揭示了现有模型在复杂环境中理解基本交通动力学能力的关键短coming。这些发现凸显了针对时空推理进行架构进步的紧迫需求。通过填补时空评估的核心差距,STSBench为开发更可靠、可解释的自动驾驶VLM提供了基础。

关键词

引用

@article{arxiv.2506.06218,
  title  = {STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving},
  author = {Christian Fruhwirth-Reisinger and Dušan Malić and Wei Lin and David Schinagl and Samuel Schulter and Horst Possegger},
  journal= {arXiv preprint arXiv:2506.06218},
  year   = {2025}
}

备注

Dataset: https://huggingface.co/datasets/ivc-lrp/STSBench, Code: https://github.com/LRP-IVC/STSBench