中文

弥合域差距:基于基础模型的自监督三维场景理解

计算机视觉与模式识别 2023-11-03 v3

摘要

基础模型在图像分割、目标检测与视觉-语言理解等 2D 与语言任务中取得了显著成果。然而,由于域差距的存在,其在丰富三维场景表示学习方面的潜力很大程度上尚未被发掘。在本工作中,我们提出了一种称为 Bridge3D 的创新方法,通过使用源自基础模型的特征、语义掩码与描述文本来预训练三维模型,以应对该差距。具体而言,我们的方法利用基础模型的语义掩码来引导掩码自编码器的掩码与重建过程,从而实现对前景表示更聚焦的注意力。此外,我们利用图像描述基础模型在场景层面弥合三维-文本差距,由此促进场景级知识蒸馏。我们进一步扩展该桥接工作,引入一种创新的对象级知识蒸馏方法,其利用基础模型提供的高精度对象级掩码与语义文本数据。我们的方法在三维目标检测与语义分割任务中显著超越现有最先进(SOTA)方法的性能。例如,在 ScanNet 数据集上,Bridge3D 将基线提升了显著的 6.3%。代码将发布于:https://github.com/Zhimin-C/Bridge3D

关键词

引用

@article{arxiv.2305.08776,
  title  = {Bridging the Domain Gap: Self-Supervised 3D Scene Understanding with Foundation Models},
  author = {Zhimin Chen and Longlong Jing and Yingwei Li and Bing Li},
  journal= {arXiv preprint arXiv:2305.08776},
  year   = {2023}
}

备注

NeurIPS 2023