中文

WaymoQA:面向自动驾驶安全关键推理的多视角视觉问答数据集

计算机视觉与模式识别 2026-02-12 v2 人工智能

摘要

近期多模态大语言模型(MLLM)的进展显示出强大的驾驶场景理解能力,引发对其在自动驾驶中的应用浓厚兴趣。然而,在安全关键场景中进行高层次推理仍是主要挑战,其中避免一种交通风险可能引发另一种风险。这种推理常仅凭单一前视角难以实现,需要综合环境的全面视角,这正是我们通过多视角输入实现的。我们定义了安全关键推理作为一种新任务,利用多视角输入来解决这一挑战。随后,我们将安全关键推理分解为两个阶段:首先解决即时风险,然后缓解由决策引发的下游风险。为支持这一目标,我们引入 WaymoQA,一个包含 35,000 组人工标注的问答对数据集,覆盖复杂且高风险的驾驶情景。数据集包括多选和开放式格式,涵盖图像和视频模态。实验表明,现有 MLLM 在安全关键场景中的表现不如正常场景,但使用 WaymoQA 进行微调后显著提升了其推理能力,这凸显了本数据集在开发更安全、更具推理能力的驾驶智能体方面的有效性。我们的代码和数据已提供于 https://github.com/sjyu001/WaymoQA。

关键词

引用

@article{arxiv.2511.20022,
  title  = {WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving},
  author = {Seungjun Yu and Seonho Lee and Namho Kim and Jaeyo Shin and Junsung Park and Wonjeong Ryu and Raehyuk Jung and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2511.20022},
  year   = {2026}
}