中文

Mix3D:面向三维场景的脱离上下文数据增强

计算机视觉与模式识别 2021-11-30 v2

摘要

我们提出 Mix3D,一种用于大规模三维场景分割的数据增强技术。由于场景上下文有助于推理物体语义,当前工作聚焦于具有大容量和感受野、能够充分捕获输入三维场景全局上下文的模型。然而,强上下文先验可能带来有害影响,例如将过街行人误认为汽车。在本工作中,我们关注平衡全局场景上下文与局部几何的重要性,旨在泛化到训练集上下文先验之外。具体而言,我们提出一种“混合”技术,通过组合两个增强场景来创建新的训练样本。如此一来,物体实例被隐式地置于新颖的脱离上下文环境中,从而使模型更难仅依赖场景上下文,而也必须从局部结构推断语义。我们进行了详细分析以理解全局上下文、局部结构以及混合场景的效果。在实验中,我们表明使用 Mix3D 训练的模型在室内(ScanNet、S3DIS)和室外数据集(SemanticKITTI)上获得显著性能提升。Mix3D 可轻易用于任何现有方法,例如,使用 Mix3D 训练的 MinkowskiNet 在 ScanNet 测试基准上以 78.1 mIoU 显著优于所有先前的 SOTA 方法。代码见:https://nekrasov.dev/mix3d/

关键词

引用

@article{arxiv.2110.02210,
  title  = {Mix3D: Out-of-Context Data Augmentation for 3D Scenes},
  author = {Alexey Nekrasov and Jonas Schult and Or Litany and Bastian Leibe and Francis Engelmann},
  journal= {arXiv preprint arXiv:2110.02210},
  year   = {2021}
}

备注

Accepted for publication at 3DV 2021. Camera-ready submission. Link to code: https://github.com/kumuji/mix3d - Project page: https://nekrasov.dev/mix3d/