中文

ViP3D:基于三维智能体查询的端到端视觉轨迹预测

计算机视觉与模式识别 2023-06-21 v3 机器人学

摘要

在现有的自动驾驶系统中,感知与预测是两个相互独立的模块。它们通过人工选取的特征(如智能体边界框与轨迹)进行交互。由于这种分离,作为下游模块的预测仅能从感知模块获得有限信息。更糟糕的是,感知模块中的误差会传播并累积,对预测结果产生不利影响。在本工作中,我们提出 ViP3D,一种基于查询的视觉轨迹预测流水线,它利用原始视频中的丰富信息直接预测场景中智能体的未来轨迹。ViP3D 在整个流水线中使用稀疏智能体查询进行检测、跟踪与预测,使其成为首个完全可微的基于视觉的轨迹预测方法。与使用历史特征图与轨迹不同,先前时间戳中的有用信息被编码于智能体查询中,这使得 ViP3D 成为一种简洁的流式预测方法。此外,在 nuScenes 数据集上的大量实验结果表明,ViP3D 相较于传统流水线与先前端到端模型具有更强的基于视觉的预测性能。

关键词

引用

@article{arxiv.2208.01582,
  title  = {ViP3D: End-to-end Visual Trajectory Prediction via 3D Agent Queries},
  author = {Junru Gu and Chenxu Hu and Tianyuan Zhang and Xuanyao Chen and Yilun Wang and Yue Wang and Hang Zhao},
  journal= {arXiv preprint arXiv:2208.01582},
  year   = {2023}
}

备注

CVPR 2023