中文

前馈 SceneDINO 用于无监督语义场景补全

计算机视觉与模式识别 2025-07-28 v2

摘要

语义场景补全(SSC)旨在从单张图像推断场景的三维几何与语义。与此前依赖昂贵真值标注的 SSC 工作不同,我们以无监督方式处理 SSC。我们的新方法 SceneDINO 将自监督表示学习和二维无监督场景理解的技术适配到 SSC。训练仅利用多视角一致性自监督,不使用任何形式的语义或几何真值。给定单张输入图像,SceneDINO 以前馈方式推断三维几何和表达性的三维 DINO 特征。通过一种新颖的三维特征蒸馏方法,我们获得无监督的三维语义。在三维和二维无监督场景理解中,SceneDINO 均达到最先进的语义分割精度。对三维特征的线性探测匹配了当前有监督 SSC 方法的语义分割精度。此外,我们展示了 SceneDINO 的域泛化能力和多视角一致性,为单图像三维场景理解奠定了坚实基础的第一步。

关键词

引用

@article{arxiv.2507.06230,
  title  = {Feed-Forward SceneDINO for Unsupervised Semantic Scene Completion},
  author = {Aleksandar Jevtić and Christoph Reich and Felix Wimbauer and Oliver Hahn and Christian Rupprecht and Stefan Roth and Daniel Cremers},
  journal= {arXiv preprint arXiv:2507.06230},
  year   = {2025}
}

备注

ICCV 2025. Christoph Reich and Aleksandar Jevti\'c - both authors contributed equally. Code: https://github.com/tum-vision/scenedino Project page: https://visinf.github.io/scenedino