中文

通过大型视觉语言模型理解交通场景情景

计算机视觉与模式识别 2025-04-08 v2

摘要

自动驾驶的深度学习模型,包括感知、规划和控制,都依赖于大规模数据集才能实现高性能。然而,这些模型的泛化能力常常因领域特定的数据分布而受到影响,因此有效的基于场景的样本分类对于提高其在不同领域中的可靠性至关重要。尽管手动标注数据具有重要价值,但其工作量大、耗时久,成为数据标注过程的瓶颈。大型视觉语言模型(LVLMs)通过在不需重新训练的情况下,通过上下文查询自动化图像分析和分类,提供了具有竞争力的解决方案。本研究评估了包括GPT-4和LLaVA在内的LVLMs的能力,来理解和分类城市交通场景,分别针对内部数据集和BDD100K。我们提出了一种可扩展的标注管道,集成最先进的模型,实现了对新数据集的灵活部署。我们的分析结合了定量指标和定性见解,表明LVLMs能够有效地理解城市交通情景,并凸显了其作为数据驱动进展在自动驾驶领域中高效工具的潜力。

关键词

引用

@article{arxiv.2501.17131,
  title  = {Scenario Understanding of Traffic Scenes Through Large Visual Language Models},
  author = {Esteban Rivera and Jannik Lübberstedt and Nico Uhlemann and Markus Lienkamp},
  journal= {arXiv preprint arXiv:2501.17131},
  year   = {2025}
}

备注

Accepted at WACV2025