中文

增强图像到LiDAR数据预训练的时空一致性

计算机视觉与模式识别 2025-12-09 v2 机器学习 机器人学

摘要

LiDAR表示学习已成为减少昂贵且耗时的人员标注工作的有前景的方法。虽然现有方法主要关注LiDAR和摄像头传感器之间的空间对齐,但常常忽视捕捉驾驶场景中运动和场景连续性的时序动态。为此,我们提出SuperFlow++,一个集成时空线索的新型框架,用于预训练和下游任务中使用连续的LiDAR-摄像头配对。SuperFlow++引入了四个关键组件:(1)一种视图一致性对齐模块,用于统一跨摄像头视图的语义信息;(2)一种稠密到稀疏一致性正则化机制,用于增强不同点云密度下的特征鲁棒性;(3)一种基于流的对比学习方法,建模时序关系以提高场景理解;(4)一种时序投票策略,用于在LiDAR扫描之间传播语义信息以提高预测一致性。在11个异构LiDAR数据集上的广泛评估表明,SuperFlow++在多样化的任务和驾驶条件下均优于最先进的方法。此外,通过在预训练期间扩展2D和3D backbone,我们发现了涌现特性,为开发可扩展的3D基础模型提供了深入见解。具有强大的通用性和计算效率,SuperFlow++为自动驾驶中基于LiDAR的数据高效感知树立了新的基准。代码已公开available at https://github.com/Xiangxu-0103/SuperFlow。

关键词

引用

@article{arxiv.2503.19912,
  title  = {Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining},
  author = {Xiang Xu and Lingdong Kong and Hui Shuai and Wenwei Zhang and Liang Pan and Kai Chen and Ziwei Liu and Qingshan Liu},
  journal= {arXiv preprint arXiv:2503.19912},
  year   = {2025}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence