中文

VLM-AutoDrive:面向安全关键自动驾驶事件的后训练视觉语言模型

计算机视觉与模式识别 2026-05-19 v2 人工智能

摘要

ego-centric dashcamfootage的快速增长为检测安全关键事件(如碰撞和near-collision)带来重大挑战,这些场景短暂、稀有且通用视觉模型难以捕获。虽然多模态大语言模型(MLLMs)显示出强大的general reasoning能力,但在driving context下表现不佳,due to domain和temporal misalignment。我们引入VLM-AutoDrive,一个用于将预训练视觉语言模型(VLMs)适配为high-fidelity异常检测的模块化后训练框架。该框架集成metadata-derived captions、LLM生成的描述、视觉问答(VQA)对和chain-of-thought(CoT)推理监督,以实现domain-aligned和可解释学习。off-the-shelf VLMs如NVIDIA的Cosmos-Reason1 7B(CR1)在zero-shot setting中collision recall为近零;通过VLM-AutoDrive微调,Collision F1从0.00提升至0.69,overall accuracy从35.35%提升至77.27%。VLM-AutoDrive为将通用VLMs适配至安全关键、时序局部化感知任务提供了可扩展配方。在real-world Nexar dashcam videos上评估,它在碰撞和near-collision检测方面实现显著提升,同时生成可解释推理痕迹,弥合了perception、causality和decision reasoning在自动驾驶中的鸿沟。

关键词

引用

@article{arxiv.2603.18178,
  title  = {VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events},
  author = {Mohammad Qazim Bhat and Yufan Huang and Niket Agarwal and Hao Wang and Michael Woods and John Kenyon and Tsung-Yi Lin and Xiaodong Yang and Ming-Yu Liu and Kevin Xie},
  journal= {arXiv preprint arXiv:2603.18178},
  year   = {2026}
}

备注

16 pages, 9 figures, submitted to arXiv