中文

通过参考合成模型实现三维场景理解

计算机视觉与模式识别 2022-03-22 v1

摘要

在点云上的视觉感知已取得令人瞩目的性能。然而,当前方法通常依赖对场景扫描的大量人工标注。本文探讨合成模型如何缓解真实场景标注负担,即以带标签的三维合成模型作为监督参考,神经网络旨在真实场景扫描上识别特定类别的物体(无场景标注用于监督)。该问题研究如何将知识从合成三维模型迁移到真实三维场景,被命名为参考迁移学习(RTL)。主要挑战在于解决合成模型与真实场景之间从单一模型到场景(model-to-scene)以及从合成模型到真实场景物体(synthetic-to-real)的差距。为此,我们提出一个简单而有效的框架来执行两种对齐操作。首先,物理数据对齐旨在通过数据处理技术使合成模型覆盖场景物体的多样性。随后,一种新颖的\textbf{凸包正则化特征对齐}引入可学习的原型,将合成模型和真实场景的点特征投影到统一特征空间,从而缓解域差距。这些操作减轻了网络在真实未见场景上识别目标物体的模型到场景和合成到真实的困难。实验表明,我们的方法通过从ModelNet数据集学习合成模型,在ScanNet和S3DIS数据集上分别取得了46.08%和55.49%的平均mAP。代码将公开可用。

关键词

引用

@article{arxiv.2203.10546,
  title  = {Towards 3D Scene Understanding by Referring Synthetic Models},
  author = {Runnan Chen and Xinge Zhu and Nenglun Chen and Dawei Wang and Wei Li and Yuexin Ma and Ruigang Yang and Wenping Wang},
  journal= {arXiv preprint arXiv:2203.10546},
  year   = {2022}
}