DriveSOTIF:通过多模态大语言模型提升感知SOTIF
机器人学
2025-09-12 v3
摘要
人类驾驶员具备空间感知和因果智能,使其能够感知驾驶情景、预见危险并应对动态环境。相比之下,自动驾驶车辆缺乏这些能力,使得在复杂或不可预测的驾驶条件下管理感知相关安全本意功能(SOTIF)风险变得具有挑战性。为解决这一差距,我们提出在专为捕捉感知相关SOTIF情景而定制的数据集上对多模态大语言模型(MLLM)进行微调。基准测试结果表明,微调后的MLLM在闭合题答准度上提升了11.8%,开放题答得分提升了12.0%,同时保持实时性能,平均每张图像推理时间为0.59秒。我们通过在加拿大和中国的实际案例研究验证了方法,微调模型正确识别了即使是经验丰富的驾驶员也会感到挑战的安全风险。这一工作代表了SOTIF领域首次应用领域特定MLLM微调。数据集及相关资源已在 github.com/s95huang/DriveSOTIF.git 提供。
引用
@article{arxiv.2505.07084,
title = {DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models},
author = {Shucheng Huang and Freda Shi and Chen Sun and Jiaming Zhong and Minghao Ning and Yufeng Yang and Yukun Lu and Hong Wang and Amir Khajepour},
journal= {arXiv preprint arXiv:2505.07084},
year = {2025}
}
备注
This work has been accepted to IEEE Transactions on Vehicular Technology. Please refer to the copyright notice for additional information