NuScenes-QA:面向自动驾驶场景的多模态视觉问答基准
计算机视觉与模式识别
2024-02-21 v2
摘要
我们引入了自动驾驶背景下的一种新颖视觉问答(VQA)任务,旨在基于街景线索回答自然语言问题。与传统 VQA 任务相比,自动驾驶场景中的 VQA 提出了更多挑战。首先,原始视觉数据是多模态的,包括分别由相机和 LiDAR 捕获的图像与点云。其次,由于连续、实时的采集,数据是多帧的。第三,室外场景同时呈现移动前景与静态背景。现有 VQA 基准未能充分应对这些复杂性。为弥补这一差距,我们提出了 NuScenes-QA,这是首个面向自动驾驶场景的 VQA 基准,包含 34K 个视觉场景和 460K 个问答对。具体而言,我们利用现有的 3D 检测标注生成场景图并手动设计问题模板。随后,基于这些模板以编程方式生成问答对。全面的统计证明我们的 NuScenes-QA 是一个具有多样问题格式的均衡大规模基准。在此基础上,我们开发了一系列采用先进 3D 检测与 VQA 技术的基线。我们大量的实验凸显了这一新任务所带来的挑战。代码与数据集可在 https://github.com/qiantianwen/NuScenes-QA 获取。
引用
@article{arxiv.2305.14836,
title = {NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario},
author = {Tianwen Qian and Jingjing Chen and Linhai Zhuo and Yang Jiao and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2305.14836},
year = {2024}
}
备注
Accepted to AAAI 2024