中文

UnO:用于感知和预测的无监督占据场

计算机视觉与模式识别 2024-06-14 v1 人工智能 机器学习 机器人学

摘要

感知世界并预测其未来状态是自动驾驶的一项关键任务。有监督方法利用标注的对象标签来学习世界模型——传统上使用对象检测和轨迹预测,或时间鸟瞰图(BEV)占据场。然而,这些标注成本高昂,且通常限于一组预定义类别,无法涵盖我们在道路上可能遇到的所有物体。相反,我们通过来自LiDAR数据的自监督学习,来感知和预测一个连续的4D(时空)占据场。这种无监督世界模型可以轻松有效地迁移到下游任务。我们通过添加一个轻量级学习渲染器来处理点云预测,并在Argoverse 2、nuScenes和KITTI上实现了最先进的性能。为了进一步展示其可迁移性,我们对模型进行微调以进行BEV语义占据预测,并表明它优于完全监督的最先进方法,尤其是在标注数据稀缺时。最后,与先前在时空几何占据预测方面的最先进技术相比,我们的4D世界模型在与自动驾驶相关的类别上实现了更高的对象召回率。

关键词

引用

@article{arxiv.2406.08691,
  title  = {UnO: Unsupervised Occupancy Fields for Perception and Forecasting},
  author = {Ben Agro and Quinlan Sykora and Sergio Casas and Thomas Gilles and Raquel Urtasun},
  journal= {arXiv preprint arXiv:2406.08691},
  year   = {2024}
}