中文

基于神经场的高效三维实例映射与定位

计算机视觉与模式识别 2024-11-26 v5

摘要

我们致力于解决从带位姿的 RGB 图像序列中学习用于三维实例分割的隐式场景表示问题。为此,我们引入了 3DIML,这是一种新颖的框架,能够高效学习神经标签场,并从新视角渲染三维实例分割掩码。与以往以自监督方式优化神经场的方法不同,那些方法需要复杂的训练过程和损失函数设计,而 3DIML 采用了两阶段过程。第一阶段 InstanceMap,以前端实例分割模型生成的图像序列的二维分割掩码作为输入,并将图像间对应的掩码关联至三维标签。这些近乎三维一致的伪标签掩码随后在第二阶段 InstanceLift 中被用于监督神经标签场的训练,该阶段插值了 InstanceMap 遗漏的区域并消除了歧义。此外,我们引入了 InstanceLoc,它能够在给定已训练神经标签场的情况下实现实例掩码的近实时定位。我们在 Replica 和 ScanNet 数据集的序列上评估了 3DIML,并证明了在图像序列的温和假设下其有效性。我们在质量相当的情况下,比现有的隐式场景表示方法实现了巨大的实际速度提升,展示了其促进更快速、更有效的三维场景理解的潜力。

关键词

引用

@article{arxiv.2403.19797,
  title  = {Efficient 3D Instance Mapping and Localization with Neural Fields},
  author = {George Tang and Krishna Murthy Jatavallabhula and Antonio Torralba},
  journal= {arXiv preprint arXiv:2403.19797},
  year   = {2024}
}