通过视觉-语言基础模型预测行人意图
计算机视觉与模式识别
2025-07-08 v1 人工智能
新兴技术
机器学习
机器人学
摘要
行人过街意图的预测是自动驾驶汽车中的一项关键功能。传统的基于视觉的过街意图预测方法通常在泛化能力、上下文理解和因果推理方面存在困难。本研究通过分层提示模板整合多模态数据,探索了视觉-语言基础模型(VLFMs)在预测行人过街意图方面的潜力。该方法将上下文信息(包括视觉帧、物理线索观测和自车动力学)纳入系统优化的提示中,以有效引导VLFMs进行意图预测。在三个常用数据集——JAAD、PIE和FU-PIP上进行了实验。结果表明,纳入车辆速度、其随时间的变化以及时间感知提示显著提高了预测准确率,最高提升达19.8%。此外,通过自动提示工程框架生成的优化提示进一步带来了12.5%的准确率提升。这些发现突显了VLFMs相较于传统基于视觉模型的优越性能,为自动驾驶应用提供了增强的泛化能力和上下文理解。
引用
@article{arxiv.2507.04141,
title = {Pedestrian Intention Prediction via Vision-Language Foundation Models},
author = {Mohsen Azarmi and Mahdi Rezaei and He Wang},
journal= {arXiv preprint arXiv:2507.04141},
year = {2025}
}