NuPlanQA:面向多视图驾驶场景的大规模数据集与基准
计算机视觉与模式识别
2025-08-07 v2 人工智能
机器人学
摘要
近期多模态大语言模型 (MLLM) 在各个领域展现出强大的性能;然而,其在驾驶场景理解方面的能力尚未得到充分验证。驾驶情境的复杂性体现在多视图信息方面,这对现有的 MLLM 构成了重大挑战。本文引入 NuPlanQA-Eval,一个用于驾驶场景理解的多视图、多模态评估基准。为支持对多视图驾驶情境的泛化,我们还提出了 NuPlanQA-1M,一个包含 100 万组真实世界视觉问答 (VQA) 配对的大规模数据集。针对交通场景的上下文感知分析,我们将数据集划分为九个子任务,涵盖三个核心技能:道路环境感知、空间关系识别和以人类视角进行推理。进一步,我们提出了 BEV-LLM,将多视图图像的鸟瞰视角 (BEV) 特征整合到 MLLM 中。我们的评估结果揭示了现有 MLLM 在驾驶场景特定感知和以人类视角进行空间推理方面的关键挑战。相比之下,BEV-LLM 在六个九个子任务中均表现出色。这些发现突显了 BEV 集成如何提升多视图 MLLM 的适应性,同时也识别了在有效适应驾驶场景方面仍需进一步完善的关键领域。为促进进一步的研究,我们将 NuPlanQA 于 GitHub 公开发布。
引用
@article{arxiv.2503.12772,
title = {NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models},
author = {Sung-Yeon Park and Can Cui and Yunsheng Ma and Ahmadreza Moradipari and Rohit Gupta and Kyungtae Han and Ziran Wang},
journal= {arXiv preprint arXiv:2503.12772},
year = {2025}
}