多视图表示是点云预训练之所需
计算机视觉与模式识别
2024-04-30 v3
摘要
预训练 3D 点云的一个有前景的方向是利用 2D 中的海量数据,而 2D 与 3D 之间的领域鸿沟带来了根本性挑战。本文提出一种新颖的点云预训练方法,通过利用预训练的 2D 网络学习 3D 表示。与先预测 2D 特征再通过维度提升获得 3D 特征的流行做法不同,我们的方法直接使用 3D 网络进行特征提取。我们在新颖的 2D 知识迁移损失的帮助下训练 3D 特征提取网络,该损失强制 3D 特征的 2D 投影与预训练 2D 网络的输出一致。为防止特征丢弃 3D 信号,我们引入多视图一致性损失,额外鼓励投影的 2D 特征表示捕捉跨不同视图的像素级对应。此类对应诱导出 3D 几何并有效在投影的 2D 特征中保留 3D 特征。实验结果表明,我们的预训练模型可成功迁移至各种下游任务,包括 3D 形状分类、部件分割、3D 目标检测与语义分割,取得了最先进的性能。
引用
@article{arxiv.2306.02558,
title = {Multi-View Representation is What You Need for Point-Cloud Pre-Training},
author = {Siming Yan and Chen Song and Youkang Kong and Qixing Huang},
journal= {arXiv preprint arXiv:2306.02558},
year = {2024}
}
备注
Published in ICLR 2024