从片段到场景:通过视觉语言模型实现自动驾驶中的时间理解
计算机视觉与模式识别
2025-12-18 v2 人工智能
摘要
自动驾驶(AD)中的时间理解仍然是一个重大挑战,即使对于近期的最先进(Vision-Language Models, VLMs)视觉语言模型也是如此。先前工作引入了旨在提升时间推理能力的数据集和基准,但这些工作侧重于其他视频内容,包括体育、烹饪和电影。尚无现有基准专门聚焦于自我中心AD视频中的时间理解所面临的独特挑战。为填补这一空白,本文提出了自动驾驶时间理解(TAD)基准,用于评估VLMs捕捉AD中动作之间动态关系的能力。TAD包含近6,000个问答(QA)对,涵盖7个人工设计的任务。此外,我们进行了评估,涵盖9个闭源和开源通用模型以及最先进(SoTA)的AD专用模型。在TAD上应用时,当前最先进模型表现出不达标的准确率,这主要是由于细粒度运动理解不完善所致。为提升TAD上的运动理解和整体准确率,本文提出了两种新颖的无需训练的解决方案:Scene-CoT,利用思维链(Chain-of-Thought, CoT);以及TCogMap,融合了自我中心时间认知地图。所提出的方法与现有VLMs集成后,将TAD上的平均准确率提升了最多17.72%。通过引入TAD、对多个最先进模型进行基准测试以及提出有效的增强方法,本工作旨在推动自动驾驶中时间理解领域的未来研究。该基准和评估代码分别可在Hugging Face和Github上获取。
引用
@article{arxiv.2512.05277,
title = {From Segments to Scenes: Temporal Understanding in Autonomous Driving via Vision-Language Model},
author = {Kevin Cannons and Saeed Ranjbar Alvar and Mohammad Asiful Hossain and Ahmad Rezaei and Mohsen Gholami and Alireza Heidarikhazaei and Zhou Weimin and Yong Zhang and Mohammad Akbari},
journal= {arXiv preprint arXiv:2512.05277},
year = {2025}
}