你的视觉语言模型已准备好用于自动驾驶安全吗?评估外部与车内风险的综合基准
机器人学
2025-11-20 v2 人工智能
摘要
视觉语言模型 (VLM) 在自动驾驶领域展现出巨大的潜力,但其在安全关键场景下的适用性尚未得到充分探索,引发了安全顾虑。这一问题源于缺乏能够同时评估外部环境风险和车内驾驶行为安全的综合性基准测试。为弥合这一关键缺口,我们引入了 DSBench——首个综合性驾驶安全基准测试,旨在统一评估 VLM 对各种安全风险的认知。DSBench 涵盖两个主要类别:外部环境风险和车内驾驶行为安全,划分为 10 个关键类别和 28 个子类别。该全面评估涵盖广泛的场景,确保对 VLMs 在安全关键情境下表现进行深入评估。对各种主流开源和闭源 VLMs 的广泛评估显示,在复杂的安全关键情境下,这些模型的性能显著下降,凸显了迫切的安全隐患。为此,我们构建了一个包含 98K 条车内及外部安全情境实例的大型数据集,表明在该数据集上微调后,现有 VLMs 的安全性能显著提升,为推动自动驾驶技术的发展铺平了道路。该基准工具包、代码和模型检查点将对公众开放获取。
引用
@article{arxiv.2511.14592,
title = {Is Your VLM for Autonomous Driving Safety-Ready? A Comprehensive Benchmark for Evaluating External and In-Cabin Risks},
author = {Xianhui Meng and Yuchen Zhang and Zhijian Huang and Zheng Lu and Ziling Ji and Yaoyao Yin and Hongyuan Zhang and Guangfeng Jiang and Yandan Lin and Long Chen and Hangjun Ye and Li Zhang and Jun Liu and Xiaoshuai Hao},
journal= {arXiv preprint arXiv:2511.14592},
year = {2025}
}