LingoQA:面向自动驾驶的视觉问答
机器人学
2024-09-27 v4 人工智能
计算机视觉与模式识别
摘要
我们推出了 LingoQA,这是一个用于自动驾驶视觉问答的全新数据集和基准。该数据集包含 28K 个独特的短视频场景和 419K 条标注。在我们的基准上评估最先进的视觉 - 语言模型显示,其性能低于人类能力,其中 GPT-4V 对 59.6% 的问题做出了真实回答,而人类为 96.6%。为了评估,我们提出了一种名为 Lingo-Judge 的真实性分类器,其与人类评估的 Spearman 相关系数达到 0.95,超越了 METEOR、BLEU、CIDEr 和 GPT-4 等现有技术。我们建立了一个基线视觉 - 语言模型,并进行了广泛的消融研究以了解其性能。我们将我们的数据集和基准作为自动驾驶领域视觉 - 语言模型的评估平台发布。
引用
@article{arxiv.2312.14115,
title = {LingoQA: Visual Question Answering for Autonomous Driving},
author = {Ana-Maria Marcu and Long Chen and Jan Hünermann and Alice Karnsund and Benoit Hanotte and Prajwal Chidananda and Saurabh Nair and Vijay Badrinarayanan and Alex Kendall and Jamie Shotton and Elahe Arani and Oleg Sinavski},
journal= {arXiv preprint arXiv:2312.14115},
year = {2024}
}
备注
Accepted to ECCV 2024. Benchmark and dataset are available at https://github.com/wayveai/LingoQA/