中文

使用视觉语言模型的驾驶场景理解层次化问答

计算机视觉与模式识别 2025-06-04 v1 人工智能

摘要

在本文中,我们提出了一种用于自动驾驶场景理解的层次化问答 (QA) 方法,在成本效率与详细视觉解释之间取得平衡。该方法在车辆运行所在特定地理区域的自定义数据集上微调了一个紧凑的视觉语言模型 (VLM),以捕获关键的驾驶相关视觉元素。在推理阶段,层次化 QA 策略将场景理解任务分解为高级和详细的子问题。VLM 不生成冗长的描述,而是导航一个结构化的问题树,其中回答高级问题(例如,“自车是否可以在交叉口左转?”)会触发更详细的子问题(例如,“是否有车辆从相反方向驶近交叉口?”)。为了优化推理时间,根据先前的答案动态跳过问题,从而最小化计算开销。然后使用手工设计的模板合成提取的答案,以确保连贯且上下文准确的场景描述。我们使用 GPT 无参考评分在自定义数据集上评估了所提出的方法,证明了其在捕获关键场景细节方面与 GPT-4o 等最先进方法具有竞争力,同时实现了显著更低的推理时间。此外,实时部署的定性结果突出了所提出方法以最小延迟捕获关键驾驶元素的能力。

关键词

引用

@article{arxiv.2506.02615,
  title  = {Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models},
  author = {Safaa Abdullahi Moallim Mohamud and Minjin Baek and Dong Seog Han},
  journal= {arXiv preprint arXiv:2506.02615},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication