Model2Scene:通过对比语言-CAD 模型预训练学习三维场景表示
计算机视觉与模式识别
2023-10-02 v1
摘要
当前成功的三维场景感知方法依赖于大规模标注点云,其获取繁琐且昂贵。本文提出 Model2Scene,一种从计算机辅助设计(CAD)模型和语言中学习免费三维场景表示的新范式。主要挑战在于 CAD 模型与真实场景物体之间的领域鸿沟,包括模型到场景(从单一模型到场景)以及合成到真实(从合成模型到真实场景物体)。为应对上述挑战,Model2Scene 首先通过混合数据增强的 CAD 模型来模拟拥挤场景。接下来,我们提出一种称为深度凸包正则化(DCR)的新颖特征正则化操作,将点特征投影到统一的凸包空间,从而缩减领域鸿沟。最终,我们对语言嵌入和 CAD 模型的点特征施加对比损失以预训练三维网络。大量实验验证所学三维场景表示有益于多种下游任务,包括无标注三维物体显著性检测、低标注三维场景感知和零样本三维语义分割。值得注意的是,Model2Scene 在无标注三维物体显著性检测上取得令人印象深刻的性能,在 ScanNet 和 S3DIS 数据集上平均 mAP 分别为 46.08% 和 55.49%。代码将公开可用。
引用
@article{arxiv.2309.16956,
title = {Model2Scene: Learning 3D Scene Representation via Contrastive Language-CAD Models Pre-training},
author = {Runnan Chen and Xinge Zhu and Nenglun Chen and Dawei Wang and Wei Li and Yuexin Ma and Ruigang Yang and Tongliang Liu and Wenping Wang},
journal= {arXiv preprint arXiv:2309.16956},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2203.10546