CarFormer:基于学习到的对象中心表征的自驾
计算机视觉与模式识别
2024-07-23 v1 人工智能
机器人学
摘要
表征的选择在自驾领域发挥关键作用。鸟瞰图(BEV)表征在近年来展现出显著的性能。本文提出学习基于对象的表征,以从复杂场景中提炼更具可操作性的信息用于自驾。我们首先在BEV序列上学习使用插槽注意力模型将对象放置到插槽中。基于这些对象中心表征,我们 then 训练一个变换器来学习驾驶以及推理其他车辆未来行为。我们发现,基于插槽的表征优于使用对象确切属性的场景级和对象级方法。插槽表征自然地整合了来自其空间和时间上下文(如位置、朝向和速度)关于对象的信息,无需显式提供。我们的方法通过插槽实现了提高的路径完成率,从而获得更高的驾驶得分,并在多个运行中表现出更低的方差,确认插槽作为对象中心方法的可靠替代方案。此外,我们通过预测实验验证了该模型作为世界模型的性能,表明其能够准确预测未来插槽表征。代码和预训练模型可在https://kuis-ai.github.io/CarFormer/获取。
引用
@article{arxiv.2407.15843,
title = {CarFormer: Self-Driving with Learned Object-Centric Representations},
author = {Shadi Hamdan and Fatma Güney},
journal= {arXiv preprint arXiv:2407.15843},
year = {2024}
}
备注
Accepted to ECCV 2024, code and the pre-trained models can be found at https://kuis-ai.github.io/CarFormer/