基于交互Transformer的端到端上下文感知与预测
计算机视觉与模式识别
2020-08-14 v1 机器人学
摘要
在本文中,我们解决了在自动驾驶场景下检测三维物体并预测其未来运动的问题。为此,我们设计了一种新颖的方法,明确考虑参与者之间的交互。为捕捉其时空依赖关系,我们提出了一种带有新颖Transformer架构的循环神经网络,称之为交互Transformer(Interaction Transformer)。重要的是,我们的模型可以端到端训练,并实时运行。我们在两个具有挑战性的真实世界数据集ATG4D和nuScenes上验证了我们的方法。我们表明,我们的方法在两个数据集上均优于当前最优(SOTA)方法。特别地,我们显著改善了估计未来轨迹之间的社会合规性,从而大幅减少了预测参与者之间的碰撞。
引用
@article{arxiv.2008.05927,
title = {End-to-end Contextual Perception and Prediction with Interaction Transformer},
author = {Lingyun Luke Li and Bin Yang and Ming Liang and Wenyuan Zeng and Mengye Ren and Sean Segal and Raquel Urtasun},
journal= {arXiv preprint arXiv:2008.05927},
year = {2020}
}
备注
IROS 2020