中文

视觉点云预测实现可扩展的自动驾驶

计算机视觉与模式识别 2024-01-01 v1

摘要

与对通用视觉的广泛研究相比,针对可扩展视觉自动驾驶的预训练仍然很少被探索。视觉自动驾驶应用需要同时包含语义、3D几何和时间信息的特征,用于联合感知、预测和规划,这对预训练提出了巨大挑战。为了解决这个问题,我们提出了一种新的预训练任务,称为视觉点云预测——从历史视觉输入预测未来点云。该任务的关键优点在于捕获了语义、3D结构和时间动态的协同学习。因此,它在各种下游任务中表现出优越性。为了应对这个新问题,我们提出了ViDAR,一个用于预训练下游视觉编码器的通用模型。它首先通过编码器提取历史嵌入。然后,这些表示通过一种新颖的潜在渲染算子转换到3D几何空间,用于未来点云预测。实验表明,在下游任务中取得了显著提升,例如3D检测的NDS提升3.1%,运动预测误差减少约10%,规划碰撞率降低约15%。

关键词

引用

@article{arxiv.2312.17655,
  title  = {Visual Point Cloud Forecasting enables Scalable Autonomous Driving},
  author = {Zetong Yang and Li Chen and Yanan Sun and Hongyang Li},
  journal= {arXiv preprint arXiv:2312.17655},
  year   = {2024}
}