中文

GPT-4V 掌舵:行人行为预测的机遇与挑战

计算机视觉与模式识别 2024-01-29 v2 人工智能 机器人学

摘要

预测行人行为是确保自动驾驶车辆安全可靠的关键。尽管深度学习方法通过从标注视频帧序列中学习已展现出前景,但它们往往未能充分把握行人与交通之间的动态交互,而这对准确预测至关重要。这些模型也缺乏细致的常识推理。此外,为这些模型手动标注数据集成本高昂且难以适应新情境。视觉语言模型(VLMs)的出现为这些问题带来了有前景的替代方案,这得益于其先进的视觉与因果推理能力。据我们所知,本研究首次在自动驾驶行人行为预测背景下对 VLM 进行定量与定性评估。我们在公开行人数据集 JAAD 与 WiDEVIEW 上评估 GPT-4V(ision)。我们的定量分析聚焦于 GPT-4V 在当前及未来帧中预测行人行为的能力。该模型以零样本方式达到 57% 的准确率,虽令人印象深刻,但在预测行人横穿动作上仍落后于最先进的领域专用模型(70%)。在定性方面,GPT-4V 展现出处理并解释复杂交通场景、区分不同行人行为以及检测和分析行人组的出色能力。然而,它也面临挑战,例如难以检测较小行人以及评估行人与自车之间的相对运动。

关键词

引用

@article{arxiv.2311.14786,
  title  = {GPT-4V Takes the Wheel: Promises and Challenges for Pedestrian Behavior Prediction},
  author = {Jia Huang and Peng Jiang and Alvika Gautam and Srikanth Saripalli},
  journal= {arXiv preprint arXiv:2311.14786},
  year   = {2024}
}