中文

GPT-4V 作为交通助手:深入探讨视觉语言模型在复杂交通事件中的表现

计算机视觉与模式识别 2024-02-08 v3

摘要

交通事件的识别与理解,尤其是交通事故,是智能交通系统和智能车辆领域中至关重要的话题。该领域一直备受学术界和工业界的广泛关注。识别和理解复杂的交通事件极具挑战性,主要是由于交通环境的复杂性、观测视角的多样性以及事故原因的多方面性。这些因素一直阻碍着有效解决方案的发展。诸如 GPT-4V 等大型视觉语言模型 的出现,为解决这一问题引入了创新方法。在本文中,我们利用一组具有代表性的交通事件视频探索了 GPT-4V 的能力,并深入探讨了该模型理解这些复杂交通状况的能力。我们观察到,GPT-4V 在某些经典交通事件中展现出了卓越的认知、推理和决策能力。同时,我们也发现了 GPT-4V 的某些局限性,这些局限性制约了其在更复杂场景下的理解能力。这些局限性值得进一步探索和解决。

关键词

引用

@article{arxiv.2402.02205,
  title  = {GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events},
  author = {Xingcheng Zhou and Alois C. Knoll},
  journal= {arXiv preprint arXiv:2402.02205},
  year   = {2024}
}