中文

面向3D场景理解的统一语义Transformer

计算机视觉与模式识别 2025-12-19 v2

摘要

整体3D场景理解涉及捕获和解析非结构化的3D环境。由于现实世界的复杂性,现有模型主要开发为特定任务,并受限于单一模型。我们提出了UNITE,一种用于3D场景理解的统一语义Transformer,一种新型前馈神经网络,统一了单一模型中多样化的3D语义任务。我们的模型以完全端到端的方式处理未见的场景,仅需几秒即可推断出完整的3D语义几何。我们的方案能够直接预测多种语义属性,包括3D场景分割、实例嵌入、开放词汇特征,以及可达性和关节属性,仅凭RGB图像即可实现。该方法通过结合2D知识蒸馏进行训练,严重依赖自监督学习,并利用设计的新型多视图损失确保3D视图一致性。我们展示了UNITE在多个语义任务上实现了最先进的性能,甚至在许多情况下超越了特定于任务的模型,甚至超过了 operate on ground truth 3D几何的方法。项目网站地址为 unite-page.github.io

关键词

引用

@article{arxiv.2512.14364,
  title  = {Unified Semantic Transformer for 3D Scene Understanding},
  author = {Sebastian Koch and Johanna Wald and Hidenobu Matsuki and Pedro Hermosilla and Timo Ropinski and Federico Tombari},
  journal= {arXiv preprint arXiv:2512.14364},
  year   = {2025}
}

备注

Project page: https://unite-page.github.io/