DriveLMM-o1: 面向驾驶场景理解的逐步推理数据集和大型多模态模型
计算机视觉与模式识别
2025-03-14 v1 机器人学
摘要
尽管大型多模态模型(LMM)在各种视觉问答(VQA)任务中表现出色,但某些挑战需要复杂的多步骤推理才能得出准确答案。其中一种尤其具有挑战性的任务是自动驾驶,这需要在做出决策前进行彻底的认知处理。在此领域,对视觉线索的顺序性和解释性理解对于有效的感知、预测和规划至关重要。然而,常见的VQA基准往往关注最终答案的准确性,而忽略了生成准确响应所必需的推理过程。此外,现有方法缺乏针对现实驾驶场景进行逐步推理评估的综合框架。为此,我们提出DriveLMM-o1,一个专为推进自动驾驶中逐步视觉推理而设计的新型数据集和基准。我们的基准包含训练集超过1.8万个VQA实例,测试集超过4000个,涵盖感知、预测和规划等多种问题类型,每个问题都包含逐步推理,以确保自动驾驶场景中的逻辑推理。我们进一步引入了一个在我们的数据集上进行推理微调的大型多模态模型,展示了在复杂驾驶场景中的稳健性能。此外,我们在我们提出的数据集上对各种开源和闭源方法进行基准测试,系统比较了它们在自动驾驶任务中的推理能力。我们的模型在最终答案准确性上实现了+7.49%的提升,推理得分相较于前一最佳开源模型提升了3.62%。我们的框架、数据集和模型已在https://github.com/ayesha-ishaq/DriveLMM-o1上发布。
引用
@article{arxiv.2503.10621,
title = {DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding},
author = {Ayesha Ishaq and Jean Lahoud and Ketan More and Omkar Thawakar and Ritesh Thawkar and Dinura Dissanayake and Noor Ahsan and Yuhao Li and Fahad Shahbaz Khan and Hisham Cholakkal and Ivan Laptev and Rao Muhammad Anwer and Salman Khan},
journal= {arXiv preprint arXiv:2503.10621},
year = {2025}
}
备注
8 pages, 4 figures, 3 tables, github: https://github.com/ayesha-ishaq/DriveLMM-o1