中文

面向室内场景解析的 3D 到 2D 蒸馏方法

计算机视觉与模式识别 2021-04-08 v2

摘要

由于遮挡、物体形变和视角变化,从 RGB 图像进行室内场景语义解析非常具有挑战性。超越以往利用几何信息(通常为成对深度图)的工作,我们提出了一种新方法——3D 到 2D 蒸馏框架,使我们能够利用从大规模 3D 数据仓库(如 ScanNet-v2)提取的 3D 特征来增强从 RGB 图像提取的 2D 特征。我们的工作有三个新颖贡献。首先,我们从预训练的 3D 网络蒸馏 3D 知识,以监督 2D 网络在训练期间从 2D 特征学习模拟的 3D 特征,从而 2D 网络在推断时无需 3D 数据。其次,我们设计了两阶段维度归一化方案来校准 2D 和 3D 特征以实现更好的融合。第三,我们设计了一个语义感知对抗训练模型,将我们的框架扩展至使用未配对 3D 数据进行训练。在 ScanNet-V2、S3DIS 和 NYU-v2 等多个数据集上的大量实验证明了我们方法的优越性。此外,实验结果表明我们的 3D 到 2D 蒸馏提升了模型泛化能力。

关键词

引用

@article{arxiv.2104.02243,
  title  = {3D-to-2D Distillation for Indoor Scene Parsing},
  author = {Zhengzhe Liu and Xiaojuan Qi and Chi-Wing Fu},
  journal= {arXiv preprint arXiv:2104.02243},
  year   = {2021}
}

备注

Accepted by CVPR 2021