中文

MM-3DScene:通过信息保持重建与自蒸馏一致性的定制化掩码建模实现三维场景理解

计算机视觉与模式识别 2023-06-12 v2

摘要

掩码建模(MM)通过重建被掩码的视觉块,已在各类视觉任务中展现出广泛成功。然而,由于数据稀疏性与场景复杂性,将 MM 应用于大规模三维场景仍是一个开放问题。二维图像中常用的传统随机掩码范式在恢复三维场景掩码区域时常常导致较高的歧义风险。为此,我们提出一种新颖的信息保持重建,其利用局部统计发现并保留具代表性的结构化点,有效增强了面向三维场景理解的 pretext 掩码任务。结合渐进式重建方式,我们的方法可专注于建模区域几何并减少掩码重建的歧义。此外,此类具有渐进掩码比例的场景也可用于自蒸馏其内在空间一致性,从而需从非掩码区域学习一致表征。通过优雅地结合掩码区域的信息保持重建与非掩码区域的一致性自蒸馏,我们得到了一个名为 MM-3DScene 的统一框架。我们在大量下游任务上进行了全面实验。一致的提升(例如目标检测上 +6.1 [email protected],语义分割上 +2.2% mIoU)证明了我们方法的优越性。

关键词

引用

@article{arxiv.2212.09948,
  title  = {MM-3DScene: 3D Scene Understanding by Customizing Masked Modeling with Informative-Preserved Reconstruction and Self-Distilled Consistency},
  author = {Mingye Xu and Mutian Xu and Tong He and Wanli Ouyang and Yali Wang and Xiaoguang Han and Yu Qiao},
  journal= {arXiv preprint arXiv:2212.09948},
  year   = {2023}
}