中文

4D 对比性 Superflow 是稠密 3D 表示学习者

计算机视觉与模式识别 2024-07-11 v2 机器学习 机器人学

摘要

在自动驾驶领域,准确的 3D 感知是基石。然而,开发此类模型依赖大量人工标注——过程既昂贵又费时。为从数据表示学习角度解决此问题,我们引入 SuperFlow,一种新型框架旨在利用连续的 LiDAR-相机配对建立时空预训练目标。SuperFlow 的独特之处在于集成两种关键设计:1)稠密到稀疏一致性正则化,促进特征学习对点云密度变化不敏感;2)基于流的对比学习模块,精心设计以从 readily 可用传感器标定中提取有意义的时序线索。为进一步提升学习效率,我们采用即插即用的视角一致性模块,以增强从相机视图蒸馏的知识对齐。广泛的跨 11 个异构 LiDAR 数据集的比较与消融实验验证了我们的有效性与优越性。此外,我们通过放大 2D 与 3D 主干网络在预训练期间的规模,观察到若干有趣的新兴属性,为 LiDAR 基于感知的 3D 基础模型研究指明了方向。

关键词

引用

@article{arxiv.2407.06190,
  title  = {4D Contrastive Superflows are Dense 3D Representation Learners},
  author = {Xiang Xu and Lingdong Kong and Hui Shuai and Wenwei Zhang and Liang Pan and Kai Chen and Ziwei Liu and Qingshan Liu},
  journal= {arXiv preprint arXiv:2407.06190},
  year   = {2024}
}

备注

ECCV 2024; 36 pages, 11 figures, 11 tables; Code at https://github.com/Xiangxu-0103/SuperFlow