ScVLM:增强针对安全关键事件理解的视觉语言模型
计算机视觉与模式识别
2025-03-11 v2
摘要
准确识别、理解和描述交通安全关键事件 (SCEs),包括碰撞、胎压冲击和近碰撞,对于先进的车辆辅助系统、自动驾驶系统和交通安全至关重要。由于 SCEs 是罕见事件,大多数通用视觉语言模型 (VLM) 未能充分训练以链接 SCE 视频和叙述内容,这可能导致幻觉并遗漏关键安全特征。本文引入 ScVLM,一种新型混合方法,集成了监督学习和对比学习技术,用于分类 SCEs 的严重程度和类型,以及生成 SCEs 的叙述描述。该方法利用分类来增强 VLM 对驾驶视频的理解能力并提高事件描述的合理性。该方法在由超过 8,600 个 SCEs 组成的 Second Strategic Highway Research Program Naturalistic Driving Study 数据集上进行训练和评估,该数据集是公开可获取的拥有视频和 SCE 标注的最大驾驶数据集。结果表明,所提出的方法在生成情境准确的事件描述方面优于现有方法,并有效缓解了 VLM 的幻觉问题。代码将在 https://github.com/datadrivenwheels/ScVLM 上提供。
引用
@article{arxiv.2410.00982,
title = {ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding},
author = {Liang Shi and Boyu Jiang and Tong Zeng and Feng Guo},
journal= {arXiv preprint arXiv:2410.00982},
year = {2025}
}
备注
To appear in Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2025