UnO:用于感知和预测的无监督占据场
计算机视觉与模式识别
2024-06-14 v1 人工智能
机器学习
机器人学
摘要
感知世界并预测其未来状态是自动驾驶的一项关键任务。有监督方法利用标注的对象标签来学习世界模型——传统上使用对象检测和轨迹预测,或时间鸟瞰图(BEV)占据场。然而,这些标注成本高昂,且通常限于一组预定义类别,无法涵盖我们在道路上可能遇到的所有物体。相反,我们通过来自LiDAR数据的自监督学习,来感知和预测一个连续的4D(时空)占据场。这种无监督世界模型可以轻松有效地迁移到下游任务。我们通过添加一个轻量级学习渲染器来处理点云预测,并在Argoverse 2、nuScenes和KITTI上实现了最先进的性能。为了进一步展示其可迁移性,我们对模型进行微调以进行BEV语义占据预测,并表明它优于完全监督的最先进方法,尤其是在标注数据稀缺时。最后,与先前在时空几何占据预测方面的最先进技术相比,我们的4D世界模型在与自动驾驶相关的类别上实现了更高的对象召回率。
引用
@article{arxiv.2406.08691,
title = {UnO: Unsupervised Occupancy Fields for Perception and Forecasting},
author = {Ben Agro and Quinlan Sykora and Sergio Casas and Thomas Gilles and Raquel Urtasun},
journal= {arXiv preprint arXiv:2406.08691},
year = {2024}
}