CLIP-FO3D:从 2D 稠密 CLIP 学习自由开放世界 3D 场景表示
计算机视觉与模式识别
2023-03-17 v2
摘要
训练 3D 场景理解模型需要复杂的人工标注,其采集费力且导致模型仅编码封闭集对象语义。相比之下,视觉-语言预训练模型(如 CLIP)已展现出显著的开放世界推理特性。为此,我们提出在无任何形式监督的情况下,将 CLIP 的特征空间直接迁移至 3D 场景理解模型。我们首先修改 CLIP 的输入与前向过程,使其能适应提取 3D 场景内容的稠密像素特征。随后我们将多视角图像特征投影至点云,并通过特征蒸馏训练 3D 场景理解模型。无需任何标注或额外训练,我们的模型在开放词汇语义与长尾概念上取得了有前景的无标注语义分割结果。此外,作为跨模态预训练框架,我们的方法可用于提升微调过程中的数据效率。我们的模型在各种零样本与数据高效学习基准上优于先前 SOTA 方法。最重要的是,我们的模型成功继承了 CLIP 的丰富结构知识,使 3D 场景理解模型不仅能识别对象概念,还能识别开放世界语义。
引用
@article{arxiv.2303.04748,
title = {CLIP-FO3D: Learning Free Open-world 3D Scene Representations from 2D Dense CLIP},
author = {Junbo Zhang and Runpei Dong and Kaisheng Ma},
journal= {arXiv preprint arXiv:2303.04748},
year = {2023}
}