探究驾驶视觉语言模型可靠性:从不一致响应到 grounding 时间推理
计算机视觉与模式识别
2026-03-11 v1
摘要
可靠的驾驶助手应基于观察信息的时间一致推理提供一致响应。本文调查视觉语言模型 (VLM) 作为驾驶助手时能否提供一致响应并理解当前观察如何塑造未来结果,或其输出是否仅反映训练期间记忆的模式而缺乏时间一致推理。虽然近期研究将 VLM 集成到自动驾驶,但先前研究通常强调场景理解和指令生成,隐含假设强视觉解释自然启用一致的未来推理从而确保可靠决策,我们在此进行批判性检验。我们聚焦于限制 VLM 在此设置下可靠性的两个主要挑战:响应不一致,即小输入扰动导致不同答案或某些情况下响应退化为接近随机猜测,以及受限的时间推理,其中模型未能从当前观察中进行序列事件推理,常导致错误或矛盾的响应。此外,我们发现视觉理解能力强的模型不一定在需要时间推理的任务上表现最佳,表明其倾向于过度依赖预训练模式而非建模时间动态。为解决这些问题,我们采用现有评估方法并引入 FutureVQA,一个人工标注的基准数据集,专为评估未来场景推理设计。此外,我们提出一种简单有效的自监督调谋方法,结合链式思维推理,提高了一致性和时间推理,无需时间标签。
引用
@article{arxiv.2603.09512,
title = {Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning},
author = {Chun-Peng Chang and Chen-Yu Wang and Holger Caesar and Alain Pagani},
journal= {arXiv preprint arXiv:2603.09512},
year = {2026}
}