超越帧的视野:基于原始时序视频与多模态线索的零样本行人意图预测
计算机视觉与模式识别
2025-07-30 v1 人工智能
机器学习
摘要
行人意图预测对于复杂城市环境中的自动驾驶至关重要。传统方法依赖于对帧序列的监督学习,并且需要大量重新训练才能适应新场景。本文提出BF-PIP(超越帧的行人意图预测),一种基于Gemini 2.5 Pro构建的零样本方法。它直接从包含结构化JAAD元数据的短连续视频片段中推断过街意图。与基于离散帧的GPT-4V方法不同,BF-PIP处理不间断的时序片段。它还通过专门的多模态提示整合了边界框注释和自车速度信息。无需任何额外训练,BF-PIP即达到了73%的预测准确率,比GPT-4V基线高出18%。这些发现表明,将时序视频输入与上下文线索相结合,增强了时空感知能力,并在模糊条件下改进了意图推断。该方法为智能交通系统中无需重新训练的敏捷感知模块铺平了道路。
引用
@article{arxiv.2507.21161,
title = {Seeing Beyond Frames: Zero-Shot Pedestrian Intention Prediction with Raw Temporal Video and Multimodal Cues},
author = {Pallavi Zambare and Venkata Nikhil Thanikella and Ying Liu},
journal= {arXiv preprint arXiv:2507.21161},
year = {2025}
}
备注
Accepted in IEEE 3rd International Conference on Artificial Intelligence, Blockchain, and Internet of Things (AIBThings 2025)