中文

Lang3DSG:基于语言的对比预训练用于三维场景图预测

计算机视觉与模式识别 2023-10-26 v1

摘要

三维场景图是一种新兴的三维场景表示,它对场景中出现的物体及其关系进行建模。然而,学习三维场景图是一项具有挑战性的任务,因为它不仅需要物体标签,还需要关系标注,而数据集中这类标注非常稀缺。尽管人们普遍认为预训练是在低数据条件下提升模型性能的有效方法,但在本文中,我们发现现有的预训练方法并不适合三维场景图。为解决此问题,我们提出了首个面向三维场景图、基于语言的预训练方法,借此利用场景图与语言之间的强关联关系。为此,我们借助流行的视觉-语言模型 CLIP 的语言编码器,将其知识蒸馏到我们基于图的网络中。我们设计了一种对比预训练,将关系(主谓宾三元组)的文本嵌入与预测的三维图特征对齐。我们的方法在主要的语义三维场景图基准上取得了最先进的结果,相较于预训练基线表现出更高的有效性,并以显著优势超越了所有现有的全监督场景图预测方法。此外,由于我们的场景图特征与语言对齐,这使我们能够以零样本方式查询特征的语言空间。在本文中,我们展示了利用特征的这一特性在无需进一步训练的情况下预测场景房间类型的示例。

关键词

引用

@article{arxiv.2310.16494,
  title  = {Lang3DSG: Language-based contrastive pre-training for 3D Scene Graph prediction},
  author = {Sebastian Koch and Pedro Hermosilla and Narunas Vaskevicius and Mirco Colosi and Timo Ropinski},
  journal= {arXiv preprint arXiv:2310.16494},
  year   = {2023}
}

备注

3DV 2024. Project page: https://kochsebastian.com/lang3dsg