提升数据高效3D场景理解的表征学习通用性
计算机视觉与模式识别
2024-06-18 v1
摘要
自监督3D表征学习领域已涌现作为缓解大量标注数据稀缺挑战的有前景的解决方案。然而,仍因缺乏多样化、大规模的真实世界3D场景数据集而受限。为此,我们提出通用表征学习(GRL),构思一种产生具有真实世界模式的多样化合成场景的生成式贝叶斯网络,并进行联合目标的预训练。通过联合学习粗到细对比学习任务和受遮挡感知的重建任务,模型获得可迁移的、几何信息驱动的表征。预训练后,在合成数据上的获得的知识可无缝迁移至两个主要的3D场景理解下游任务,即3D目标检测和3D语义分割,使用真实世界基准数据集。一系列充分的实验稳健地显示,我们的方法在现有SOTA预训练方法中持续显著优于。
引用
@article{arxiv.2406.11283,
title = {Enhancing Generalizability of Representation Learning for Data-Efficient 3D Scene Understanding},
author = {Yunsong Wang and Na Zhao and Gim Hee Lee},
journal= {arXiv preprint arXiv:2406.11283},
year = {2024}
}