中文

从转向到踏踏:自动驾驶视觉语言模型在自行车辅助空间感知与规划方面是否具有普适性?

计算机视觉与模式识别 2026-02-12 v1 机器人学

摘要

自行车常在城市交通中遇到安全关键情形,凸显了支持安全且信息充足决策的辅助系统的需求。最近,视觉语言模型(VLMs)在自动驾驶基准测试中表现出色,表明其在一般交通理解和导航相关推理方面具有潜力。然而,现有评估主要以车辆为中心,未能从自行车的视角评估感知与推理。为此,我们引入 CyclingVQA,一个旨在探索自行车视角下感知、时空理解和交通规则到车道推理的诊断基准。我们评估了 31+ 个最新 VLMs,涵盖通用型、空间增强型和专注于自动驾驶的模型,发现当前模型展现出鼓舞的能力,同时也揭示了在自行车中心感知与推理方面存在明显改进空间,尤其是在解释自行车特定交通线征和将标识正确关联到相应车道方面。值得注意的是,一些驾驶专用模型反而不如强大的通用 VLMs,表明从车辆中心训练的模型在自行车辅助场景中的迁移能力有限。最后,通过系统化的错误分析,我们识别了一系列常见的失败模式,以指导开发更有效的自行车辅助智能系统。

关键词

引用

@article{arxiv.2602.10771,
  title  = {From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?},
  author = {Krishna Kanth Nakka and Vedasri Nakka},
  journal= {arXiv preprint arXiv:2602.10771},
  year   = {2026}
}

备注

Preprint