基于多模态Transformer的上下文感知行人轨迹预测
计算机视觉与模式识别
2023-07-11 v1
摘要
我们提出了一种预测行人未来轨迹的新方案。我们的方法使用多模态编码器-解码器 Transformer 架构,以行人位置和自车速度为输入。值得注意的是,我们的解码器以单次前向传播预测整个未来轨迹,而不进行一步向前预测,这使得该方法对于嵌入式边缘部署十分有效。我们进行了详细实验,并在两个流行数据集 PIE 和 JAAD 上评估了我们的方法。定量结果表明,我们提出的模型优于当前最先进水平,在 0.5、1.0 和 1.5 秒三个时间范围内始终达到最低误差。此外,对于 PIE 和 JAAD 两个数据集,所提方法显著快于最先进方法。最后,消融实验证明了我们方法关键多模态配置的影响。
引用
@article{arxiv.2307.03786,
title = {Context-aware Pedestrian Trajectory Prediction with Multimodal Transformer},
author = {Haleh Damirchi and Michael Greenspan and Ali Etemad},
journal= {arXiv preprint arXiv:2307.03786},
year = {2023}
}