中文

基于特征融合与时空注意力预测行人过街意图

计算机视觉与模式识别 2021-10-14 v2

摘要

预测弱势道路使用者行为是在现实世界中部署自动驾驶系统(Automated Driving Systems, ADS)的必要前提。行人过街意图应被实时识别,尤其对于城市驾驶而言。近期工作已展示基于视觉的深度神经网络模型在该任务上的潜力。然而,这些模型不够鲁棒,某些问题仍待解决。首先,表征目标行人与场景之间交互的全局时空上下文尚未被恰当利用。其次,融合不同传感器数据的最优策略尚未被充分研究。本工作通过引入一种新颖的神经网络架构来融合本质不同的时空特征以预测行人过街意图,从而解决上述局限。我们利用注意力机制与一组循环神经网络,以最优方式融合不同现象,如 RGB 图像序列、语义分割掩码以及自车速度。最优架构通过详尽的消融与对比研究获得。在 JAAD 行人动作预测基准上的大量对比实验证明了所提方法的有效性,其取得了最先进的性能。我们的代码已开源并公开可用。

关键词

引用

@article{arxiv.2104.05485,
  title  = {Predicting Pedestrian Crossing Intention with Feature Fusion and Spatio-Temporal Attention},
  author = {Dongfang Yang and Haolin Zhang and Ekim Yurtsever and Keith Redmill and Ümit Özgüner},
  journal= {arXiv preprint arXiv:2104.05485},
  year   = {2021}
}

备注

Submitted to IEEE Transactions on Intelligent Vehicles