面向SOTIF条件下2D目标检测的大型视觉-语言模型比较评估
计算机视觉与模式识别
2026-02-02 v1 机器人学
摘要
可靠的环境感知仍是自动驾驶安全运行的主要障碍。安全即所需功能(SOTIF)关注感知不足导致的安全风险,尤其是在常规检测器常常付之东流的恶劣条件下。虽然大型视觉-语言模型(LVLMs)在语义推理方面显示出前景,但其在安全关键2D目标检测上的定量有效性尚未得到充分探索。本文针对长尾交通情景和环境退化,构建了PeSOTIF数据集,对十个具代表性的LVLMs进行系统评估。结果在复杂自然场景下,顶级LVLMs(如Gemini 3、豆包)相较于YOLO基线在召回率上提升超过25%,在视觉退化方面表现出更强鲁棒性。相比之下,基线在合成扰动的几何精度方面仍占优势。这些发现凸显了语义推理与几何回归之间的互补优势,支持将LVLMs作为以SOTIF为导向的自动驾驶系统中的高级安全验证器。
引用
@article{arxiv.2601.22830,
title = {A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions},
author = {Ji Zhou and Yilin Ding and Yongqi Zhao and Jiachen Xu and Arno Eichberger},
journal= {arXiv preprint arXiv:2601.22830},
year = {2026}
}
备注
6 pages, 11 figures