Swin3D++:用于 3D 室内场景理解的有效多源预训练
计算机视觉与模式识别
2024-02-23 v1
摘要
数据多样性和丰富性对于提高自然语言处理和 2D 视觉模型的性能与泛化能力至关重要。然而,3D 视觉领域面临 3D 数据匮乏的问题,且简单地组合多个 3D 数据集来预训练 3D 主干网络并不能产生显著改进,这是由于不同 3D 数据集之间的领域差异阻碍了有效的特征学习。在本工作中,我们识别了 3D 室内场景数据集之间领域差异的主要来源,并提出了 Swin3D++,这是一种基于 Swin3D 的增强架构,旨在对多源 3D 点云进行高效预训练。Swin3D++ 向 Swin3D 的模块引入了领域特定机制,以解决领域差异并增强网络在多源预训练上的能力。此外,我们设计了一种简单的源增强策略,以增加预训练数据规模并促进监督预训练。我们验证了设计的有效性,并证明 Swin3D++ 在典型的室内场景理解任务上超越了最先进的 3D 预训练方法。我们的代码和模型将在 https://github.com/microsoft/Swin3D 发布。
引用
@article{arxiv.2402.14215,
title = {Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding},
author = {Yu-Qi Yang and Yu-Xiao Guo and Yang Liu},
journal= {arXiv preprint arXiv:2402.14215},
year = {2024}
}
备注
technical report