中文

通过视觉-语言基础模型预测行人意图

计算机视觉与模式识别 2025-07-08 v1 人工智能 新兴技术 机器学习 机器人学

摘要

行人过街意图的预测是自动驾驶汽车中的一项关键功能。传统的基于视觉的过街意图预测方法通常在泛化能力、上下文理解和因果推理方面存在困难。本研究通过分层提示模板整合多模态数据,探索了视觉-语言基础模型(VLFMs)在预测行人过街意图方面的潜力。该方法将上下文信息(包括视觉帧、物理线索观测和自车动力学)纳入系统优化的提示中,以有效引导VLFMs进行意图预测。在三个常用数据集——JAAD、PIE和FU-PIP上进行了实验。结果表明,纳入车辆速度、其随时间的变化以及时间感知提示显著提高了预测准确率,最高提升达19.8%。此外,通过自动提示工程框架生成的优化提示进一步带来了12.5%的准确率提升。这些发现突显了VLFMs相较于传统基于视觉模型的优越性能,为自动驾驶应用提供了增强的泛化能力和上下文理解。

关键词

引用

@article{arxiv.2507.04141,
  title  = {Pedestrian Intention Prediction via Vision-Language Foundation Models},
  author = {Mohsen Azarmi and Mahdi Rezaei and He Wang},
  journal= {arXiv preprint arXiv:2507.04141},
  year   = {2025}
}