中文

增强面向安全关键驾驶视频分析的多模态大语言模型

计算机视觉与模式识别 2026-05-22 v1 机器学习

摘要

近期在多模态大语言模型 (MLLM) 方面的突破显示出在一般视觉理解方面的惊人能力。然而,其在安全关键驾驶场景的应用仍受限于无法准确感知和推理稀有高风险动态事件,如碰撞或接近碰撞。为此,我们引入一个管道,通过融合降采样视频帧与同步的高频遥感数据 (IMU 和 GPS) 以及来自专用计算机视觉模型的语义见解来增强 MLLM 的感知能力。我们的管道生成高质量的伪标签,包括描述性标题和问答对,旨在训练 MLLM 识别和描述真实驾驶 footage 中的安全关键事件 (SCE)。我们展示了通过 DoRA adapter 微调开源 QwenVL-2.5 模型的效果:我们的实验显示,在有限计算预算下并使用少于 5000 万可训练参数,显著提高了识别和解释安全关键事件的能力。

关键词

引用

@article{arxiv.2605.22185,
  title  = {Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis},
  author = {Tomaso Trinci and Henrique Piñeiro Monteagudo and Leonardo Taccari},
  journal= {arXiv preprint arXiv:2605.22185},
  year   = {2026}
}

备注

Accepted at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)