中文

ACIT:面向行人跨越意图预测的注意力引导的跨模态交互 Transformer

计算机视觉与模式识别 2025-11-26 v1

摘要

预测行人跨越意图对于防止自动驾驶车辆发生行人相关碰撞至关重要。然而,有效提取和整合来自不同类型数据的互补线索仍是主要挑战之一。本文提出一种注意力引导的跨模态交互 Transformer(ACIT),用于行人跨越意图预测。ACIT 利用六种视觉和运动模态,这些模态被分组为三个交互对:(1) 全局语义图和全局光流,(2) 局部 RGB 图像和局部光流,(3) 车辆速度和行人边界框。 在每个视觉交互对内,双路径注意力机制通过自注意力增强主要模态中显著区域,并通过光流引导注意力实现与辅助模态(即光流)的深度交互。在运动交互对内,采用跨模态注意力来建模跨模态动态,从而实现对互补运动特征的有效提取。除两两交互外,一个多模态特征融合模块进一步促进了每个时间步上的跨模态交互。此外,引入基于 Transformer 的时序特征聚合模块以捕获序列依赖性。实验结果表明,ACIT 在 JAADbeh 和 JAADall 数据集上分别实现了 70% 和 89% 的准确率,显著优于当前最先进的方法。进一步开展了大量消融实验,以探讨ACIT 各模块的贡献。

关键词

引用

@article{arxiv.2511.20020,
  title  = {ACIT: Attention-Guided Cross-Modal Interaction Transformer for Pedestrian Crossing Intention Prediction},
  author = {Yuanzhe Li and Steffen Müller},
  journal= {arXiv preprint arXiv:2511.20020},
  year   = {2025}
}