中文

基于多模态Transformer的上下文感知行人轨迹预测

计算机视觉与模式识别 2023-07-11 v1

摘要

我们提出了一种预测行人未来轨迹的新方案。我们的方法使用多模态编码器-解码器 Transformer 架构,以行人位置和自车速度为输入。值得注意的是,我们的解码器以单次前向传播预测整个未来轨迹,而不进行一步向前预测,这使得该方法对于嵌入式边缘部署十分有效。我们进行了详细实验,并在两个流行数据集 PIE 和 JAAD 上评估了我们的方法。定量结果表明,我们提出的模型优于当前最先进水平,在 0.5、1.0 和 1.5 秒三个时间范围内始终达到最低误差。此外,对于 PIE 和 JAAD 两个数据集,所提方法显著快于最先进方法。最后,消融实验证明了我们方法关键多模态配置的影响。

关键词

引用

@article{arxiv.2307.03786,
  title  = {Context-aware Pedestrian Trajectory Prediction with Multimodal Transformer},
  author = {Haleh Damirchi and Michael Greenspan and Ali Etemad},
  journal= {arXiv preprint arXiv:2307.03786},
  year   = {2023}
}