通过蒸馏视觉基础模型分割任意点云序列
计算机视觉与模式识别
2023-10-25 v2 机器学习
机器人学
摘要
视觉基础模型(VFMs)近期的进展为通用且高效的视觉感知开辟了新可能。本文中,我们介绍 Seal,一种利用 VFMs 分割多种汽车点云序列的新框架。Seal 展现出三个引人注目的特性:i) 可扩展性:VFMs 被直接蒸馏到点云中,在预训练期间无需 2D 或 3D 标注。ii) 一致性:在相机到 LiDAR 以及点到片段正则化阶段同时强制空间与时间关系,促进跨模态表征学习。iii) 泛化性:Seal 以免训练的方式将知识迁移至涉及多样点云的下游任务,包括来自真实/合成、低/高分辨率、大/小规模以及干净/损坏数据集的点云。在十一个点云数据集上进行的广泛实验展示了 Seal 的有效性与优越性。值得注意的是,Seal 在线性探测后于 nuScenes 上取得 45.0% mIoU,超越随机初始化 36.9% mIoU,并优于先前最佳方法 6.1% mIoU。此外,在所有十一个被测点云数据集的 20 个不同少样本微调任务上,Seal 相较现有方法展现出显著性能增益。
引用
@article{arxiv.2306.09347,
title = {Segment Any Point Cloud Sequences by Distilling Vision Foundation Models},
author = {Youquan Liu and Lingdong Kong and Jun Cen and Runnan Chen and Wenwei Zhang and Liang Pan and Kai Chen and Ziwei Liu},
journal= {arXiv preprint arXiv:2306.09347},
year = {2023}
}
备注
NeurIPS 2023 (Spotlight); 37 pages, 16 figures, 15 tables; Code at https://github.com/youquanl/Segment-Any-Point-Cloud