通过几何引导自蒸馏实现开放词汇3D场景理解
计算机视觉与模式识别
2024-07-19 v1
摘要
大规模3D-文本配对数据的稀缺性是开放词汇3D场景理解的主要挑战,因此流行做法是利用互联网规模的2D数据,通过知识蒸馏将其开放词汇能力传递给3D模型。然而,现有基于蒸馈的3D场景理解方法依赖2D模型的表示能力,忽略了对几何先验和3D数据固有表示优势的探索。本文提出一种有效方法,即几何引导自蒸馈(GGSD),从2D预训练模型中学习优异的3D表示。具体而言,我们首先设计了几何引导蒸馈模块,从2D模型蒸馈知识,然后利用3D几何先验来缓解2D模型内在的噪声并增强表示学习过程。鉴于3D表示的优势,蒸馈后的3D学生模型性能显著优于2D教师模型。这激励我们进一步利用3D数据的表示优势进行自蒸馈。结果表明,所提GGSD方法在室内和室外基准数据集上均显著优于现有开放词汇3D场景理解方法。
关键词
引用
@article{arxiv.2407.13362,
title = {Open Vocabulary 3D Scene Understanding via Geometry Guided Self-Distillation},
author = {Pengfei Wang and Yuxi Wang and Shuai Li and Zhaoxiang Zhang and Zhen Lei and Lei Zhang},
journal= {arXiv preprint arXiv:2407.13362},
year = {2024}
}