跟踪与大型多模态模型在驾驶场景理解中的结合
计算机视觉与模式识别
2025-03-19 v1 机器人学
摘要
大型多模态模型(LMM)最近在自动驾驶研究中受到广泛关注,在各种新兴基准测试中展现出有前景的能力。专门针对该领域设计的 LMM 已证明了其有效的感知、规划和预测能力。然而,这些方法中的许多未能充分利用三维空间和时间元素,主要依赖图像数据。因此,它们在动态驾驶环境中的有效性受到限制。我们提出将跟踪信息作为额外输入,以恢复图像中未能有效捕捉的三维空间和时间细节。我们引入了一种将跟踪信息嵌入 LMM 的创新方法,以增强其对驾驶场景的时空理解。通过跟踪编码器融入三维跟踪数据,我们在丰富视觉查询中的关键时空线索的同时,避免了处理长视频序列或大量三维输入的计算开销。此外,我们采用自监督方法预训练跟踪编码器,为 LMM 提供额外的上下文信息,显著提升了其在自动驾驶感知、规划和预测任务中的性能。实验结果证明了该方法的有效性,在 DriveLM-nuScenes 基准测试上相比基线模型准确率提升 9.5%,ChatGPT 分数增加 7.04 分,总体分数提升 9.4%,在 DriveLM-CARLA 上最终分数提升 3.7%。我们的代码可在 https://github.com/mbzuai-oryx/TrackingMeetsLMM 获取。
引用
@article{arxiv.2503.14498,
title = {Tracking Meets Large Multimodal Models for Driving Scenario Understanding},
author = {Ayesha Ishaq and Jean Lahoud and Fahad Shahbaz Khan and Salman Khan and Hisham Cholakkal and Rao Muhammad Anwer},
journal= {arXiv preprint arXiv:2503.14498},
year = {2025}
}
备注
13 pages, 8 figures, Github: https://github.com/mbzuai-oryx/TrackingMeetsLMM