评估小型视觉语言模型在距离相关交通感知中的表现
计算机视觉与模式识别
2025-12-11 v2 人工智能
摘要
视觉语言模型 (VLM) 正变得越来越强大,显示出在需要视觉和文本理解的各种任务中表现突出。其强大的泛化能力使其成为自动驾驶系统的有前景的组件,必须处理意外的边界情况。然而,要在此类安全关键应用中受信任,模型首先必须具备可靠的感知系统。此外,由于交通场景中的关键对象和代理往往位于距离较远的地方,我们需要具备在近距离(最高 20 米)和远距离(30 米以上)都具有强感知能力的系统。为此,我们引入 Distance-Annotated Traffic Perception Question Answering (DTPQA),这是首个专注于交通场景中基于感知的问题的视觉问答 (VQA) 基准数据集,包含距离标注。通过排除需要推理的问题,我们确保模型性能仅反映感知能力。由于自动驾驶硬件的处理能力有限,无法支持大型 VLM,我们的研究聚焦于小型 VLM。具体而言,我们在 DTPQA 上评估了多个最新 (SOTA) 小型 VLM,结果显示尽管问题相对简单,这些模型在表现上显著低于人类(最佳小型 VLM 的平均准确率约为 60%,而人类约为 85%)。需要注意的是,人类样本量相对较小,这带来了统计上的局限性。我们还识别出了诸如区分左右等特定感知任务,这些模型仍然具有挑战性。
引用
@article{arxiv.2510.08352,
title = {Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception},
author = {Nikos Theodoridis and Tim Brophy and Reenu Mohandas and Ganesh Sistu and Fiachra Collins and Anthony Scanlan and Ciaran Eising},
journal= {arXiv preprint arXiv:2510.08352},
year = {2025}
}
备注
Published in IEEE Open Journal of Vehicular Technology. Final version available at: https://ieeexplore.ieee.org/document/11230063