中文

用于城市环境中行人越线意图预测的多上下文融合变换器

计算机视觉与模式识别 2026-03-24 v2 人工智能

摘要

行人越线意图预测是提高自动驾驶车辆行人安全性和减少交通事故的关键技术。然而,在城市环境中准确的行人意图预测仍具有挑战性 due to the 众多影响行人行为因素。本文提出了一种多上下文融合变换器(MFT),该模型利用四个关键维度中 diverse 数值上下文属性,涵盖行人行为上下文、环境上下文、行人定位上下文和车辆运动上下文,以实现精准的行人意图预测。MFT 采用渐进式融合策略,其中互惠内部上下文注意力 enable 行人在每个上下文内进行相互交互,从而促进特征序列融合并生成特定于上下文的上下文标记。随后,互惠跨上下文注意力将跨越上下文的特征整合,由全局 CLS 标记作为紧凑的多上下文表示。最后,引导式内部上下文注意力通过引导式信息传播在每个上下文内细化上下文标记,同时引导式跨上下文注意力强化全局 CLS 标记,以促进多上下文融合,实现更深入且更高效的整合。实验结果表明,MFT 在 JAADbeh、JAADall 和 PIE 数据集上分别实现了 73%、93% 和 90% 的准确率。进一步开展了大量消融研究,以探讨网络架构的有效性以及不同输入上下文的贡献。我们的代码已开源:https://github.com/ZhongHang0307/Multi-Context-Fusion-Transformer。

关键词

引用

@article{arxiv.2511.20011,
  title  = {Multi-Context Fusion Transformer for Pedestrian Crossing Intention Prediction in Urban Environments},
  author = {Yuanzhe Li and Hang Zhong and Steffen Müller},
  journal= {arXiv preprint arXiv:2511.20011},
  year   = {2026}
}