中文

NuScenes-QA:面向自动驾驶场景的多模态视觉问答基准

计算机视觉与模式识别 2024-02-21 v2

摘要

我们引入了自动驾驶背景下的一种新颖视觉问答(VQA)任务,旨在基于街景线索回答自然语言问题。与传统 VQA 任务相比,自动驾驶场景中的 VQA 提出了更多挑战。首先,原始视觉数据是多模态的,包括分别由相机和 LiDAR 捕获的图像与点云。其次,由于连续、实时的采集,数据是多帧的。第三,室外场景同时呈现移动前景与静态背景。现有 VQA 基准未能充分应对这些复杂性。为弥补这一差距,我们提出了 NuScenes-QA,这是首个面向自动驾驶场景的 VQA 基准,包含 34K 个视觉场景和 460K 个问答对。具体而言,我们利用现有的 3D 检测标注生成场景图并手动设计问题模板。随后,基于这些模板以编程方式生成问答对。全面的统计证明我们的 NuScenes-QA 是一个具有多样问题格式的均衡大规模基准。在此基础上,我们开发了一系列采用先进 3D 检测与 VQA 技术的基线。我们大量的实验凸显了这一新任务所带来的挑战。代码与数据集可在 https://github.com/qiantianwen/NuScenes-QA 获取。

关键词

引用

@article{arxiv.2305.14836,
  title  = {NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario},
  author = {Tianwen Qian and Jingjing Chen and Linhai Zhuo and Yang Jiao and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2305.14836},
  year   = {2024}
}

备注

Accepted to AAAI 2024