中文

基于多模态融合网络的行人越线意图预测

计算机视觉与模式识别 2026-03-25 v2 人工智能

摘要

行人越线意图预测是实现自动驾驶车辆(AVs)在城市环境中部署的关键。理想的预测为AVs提供关键的环境线索,从而降低与行人相关的碰撞风险。然而,预测任务具有挑战性,由于行人行为的多样性以及其对多个环境因素的依赖。本文提出一种多模态融合网络,利用来自视觉和运动分支的七种模态特征,旨在有效地提取和整合不同模态之间的互补线索。具体而言,运动和视觉特征使用多个基于Transformer的提取模块从原始输入中提取。深度引导注意力模块利用深度信息通过全面的空间特征相互作用,引导注意力聚焦于另一个模态中最突出的区域。为 accounts for 不同模态和帧的重要性差异,设计了模态注意力和时间注意力,以选择性地强调信息丰富的模态并有效捕获时间依赖性。在JAAD数据集上的大量实验验证了所提出网络的有效性,实现了对基线方法的优异性能。

关键词

引用

@article{arxiv.2511.20008,
  title  = {Pedestrian Crossing Intention Prediction Using Multimodal Fusion Network},
  author = {Yuanzhe Li and Steffen Müller},
  journal= {arXiv preprint arXiv:2511.20008},
  year   = {2026}
}

备注

29th IAVSD International Symposium on Dynamics of Vehicles on Roads and Tracks (IAVSD 2025)