VisionPAD:面向自动驾驶的视觉中心预训练范式
计算机视觉与模式识别
2025-05-23 v2 机器学习
机器人学
摘要
本文介绍了VisionPAD,一种为自动驾驶中基于视觉的算法设计的新型自监督预训练范式。与之前采用显式深度监督的神经渲染方法不同,VisionPAD利用更高效的3D高斯溅写(3D Gaussian Splatting)仅使用图像作为监督来重建多视图表示。具体而言,我们引入了一种自监督的体素速度估计方法。通过对体素进行位姿变换并对渲染输出进行监督,模型有效地学习了序列数据中的运动线索。此外,我们采用多帧光谱一致性方法来增强几何感知。它根据渲染深度和相对姿态将相邻帧投影到当前帧,从而通过纯图像监督提升3D几何表征。在自动驾驶数据集上的广泛实验表明,VisionPAD在3D目标检测、占据网格预测和地图分割等任务上显著优于当前领先的预训练策略。
引用
@article{arxiv.2411.14716,
title = {VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving},
author = {Haiming Zhang and Wending Zhou and Yiyao Zhu and Xu Yan and Jiantao Gao and Dongfeng Bai and Yingjie Cai and Bingbing Liu and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2411.14716},
year = {2025}
}
备注
Accepted at CVPR 2025