NuScenes-MQA:使用标记注释对自动驾驶数据集进行描述与问答的集成评估
计算机视觉与模式识别
2023-12-12 v1 计算与语言
摘要
视觉问答(VQA)是自动驾驶中最重要的任务之一,它要求精确的识别和复杂场景评估。然而,以问答格式标注的数据集——这种格式能保证从驾驶场景中生成精确语言并进行场景识别——尚未被建立。在这项工作中,我们引入了Markup-QA,一种新颖的数据集标注技术,其中问答对被封装在标记内。这种方法有助于同时评估模型在句子生成和VQA方面的能力。此外,利用这种标注方法,我们设计了NuScenes-MQA数据集。该数据集通过同时关注描述能力和精确问答,赋能视觉语言模型的发展,尤其针对自动驾驶任务。数据集可在 https://github.com/turingmotors/NuScenes-MQA 获取。
引用
@article{arxiv.2312.06352,
title = {NuScenes-MQA: Integrated Evaluation of Captions and QA for Autonomous Driving Datasets using Markup Annotations},
author = {Yuichi Inoue and Yuki Yada and Kotaro Tanahashi and Yu Yamaguchi},
journal= {arXiv preprint arXiv:2312.06352},
year = {2023}
}
备注
Accepted at LLVM-AD Workshop @ WACV 2024