Shape2Scene:通过在形状数据上预训练的 3D 场景表示学习
计算机视觉与模式识别
2024-07-16 v1 人工智能
摘要
当前 3D 自监督学习方法因 3D 场景数据收集耗时且昂贵,面临数据沙漠问题。相反,3D 形状数据更易收集。尽管如此,现有的形状数据预训练策略在 3D 场景理解方面潜力有限,由于点数目差异显著。为此,本文提出 Shape2Scene(S2S),一种从 3D 形状数据学习大规模 3D 场景表示的新方法。我们首先为形状与场景级别的 3D 任务分别设计多尺度高分辨率骨干网络,即 MH-P(基于点的)和 MH-V(基于体素的)。MH-P/V 建立了通往高分辨率特征的直接路径,这些特征捕获跨多个尺度的深层语义信息。这种特性使其适用于广泛的 3D 下游任务,这些任务高度依赖高分辨率特征。随后,我们采用一种形状到场景的策略(S2SS)将来自各种形状的点融合,创建用于训练数据的随机伪场景(由多个物体组成),缓解形状与场景之间的差异。最后,对 MH-P/V 应用点-点 对比损失(PPC)进行预训练。在 PPC 中,S2SS 天然获得了内在对应关系(即点对)。广泛的实验表明,由 MH-P/V 学习的 3D 表示在形状级别和场景级别的 3D 任务之间具有良好的可迁移性。MH-P 在著名点云数据集上取得显著性能(在 ScanObjectNN 上达 93.8% 的 OA,在 ShapeNetPart 上达 87.6% 的实例 mIoU)。MH-V 也在 3D 语义分割和 3D 对象检测中取得有前景的性能。
引用
@article{arxiv.2407.10200,
title = {Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data},
author = {Tuo Feng and Wenguan Wang and Ruijie Quan and Yi Yang},
journal= {arXiv preprint arXiv:2407.10200},
year = {2024}
}
备注
ECCV 2024; Project page: https://github.com/FengZicai/S2S