中文

Swin3D++:用于 3D 室内场景理解的有效多源预训练

计算机视觉与模式识别 2024-02-23 v1

摘要

数据多样性和丰富性对于提高自然语言处理和 2D 视觉模型的性能与泛化能力至关重要。然而,3D 视觉领域面临 3D 数据匮乏的问题,且简单地组合多个 3D 数据集来预训练 3D 主干网络并不能产生显著改进,这是由于不同 3D 数据集之间的领域差异阻碍了有效的特征学习。在本工作中,我们识别了 3D 室内场景数据集之间领域差异的主要来源,并提出了 Swin3D++,这是一种基于 Swin3D 的增强架构,旨在对多源 3D 点云进行高效预训练。Swin3D++ 向 Swin3D 的模块引入了领域特定机制,以解决领域差异并增强网络在多源预训练上的能力。此外,我们设计了一种简单的源增强策略,以增加预训练数据规模并促进监督预训练。我们验证了设计的有效性,并证明 Swin3D++ 在典型的室内场景理解任务上超越了最先进的 3D 预训练方法。我们的代码和模型将在 https://github.com/microsoft/Swin3D 发布。

关键词

引用

@article{arxiv.2402.14215,
  title  = {Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding},
  author = {Yu-Qi Yang and Yu-Xiao Guo and Yang Liu},
  journal= {arXiv preprint arXiv:2402.14215},
  year   = {2024}
}

备注

technical report