GaussianPretrain:一种用于自动驾驶视觉预训练的简单统一 3D 高斯表示
计算机视觉与模式识别
2024-11-20 v1
摘要
自监督学习在图像处理领域取得了长足进步,而自动驾驶的视觉预训练仍处于起步阶段。现有方法通常侧重于学习几何场景信息而忽略纹理,或将两者分别处理,阻碍了对场景的全面理解。在此背景下,我们很高兴地介绍 GaussianPretrain,这是一种新颖的预训练范式,通过统一整合几何与纹理表示实现对场景的整体理解。我们的方法将 3D 高斯锚点概念化为体素 LiDAR 点,学习对场景的深入理解,以利用详细的空间结构和纹理增强预训练性能,其速度比基于 NeRF 的方法 UniPAD 快 40.6%,且仅需 70% 的 GPU 内存。我们在多个 3D 感知任务上证明了 GaussianPretrain 的有效性,展示了显著的性能提升,例如 3D 目标检测的 NDS 提升 7.05%,HD map 构建的 mAP 提升 1.9%,Occupancy 预测提升 0.8%。这些显著的收益突显了 GaussianPretrain 的理论创新与强大的实用潜力,推动了自动驾驶视觉预训练的发展。源代码将在 https://github.com/Public-BOTs/GaussianPretrain 公开
引用
@article{arxiv.2411.12452,
title = {GaussianPretrain: A Simple Unified 3D Gaussian Representation for Visual Pre-training in Autonomous Driving},
author = {Shaoqing Xu and Fang Li and Shengyin Jiang and Ziying Song and Li Liu and Zhi-xin Yang},
journal= {arXiv preprint arXiv:2411.12452},
year = {2024}
}
备注
10 pages, 5 figures