中文

SAB3R:三维重建中的语义增强骨干网络

计算机视觉与模式识别 2025-06-05 v2

摘要

我们引入了一项新任务“建图与定位”,它统一了两个传统上独立的目标:开放词汇分割——基于自然语言查询检测并分割目标实例——与三维重建,即从视觉输入估计场景三维结构的过程。具体而言,“建图与定位”涉及从未定姿视频中生成点云,并基于开放词汇查询分割目标实例。该任务作为迈向现实世界具身AI应用的关键一步,引入了一项桥接重建、识别与重组的实用任务。为应对该任务,我们引入了一个简单而有效的基线,我们将其称为SAB3R。我们的方法建立在三维计算机视觉最近的突破MASt3R之上,并采用了一种轻量级的蒸馏策略。该方法将来自二维视觉骨干网络(如CLIP和DINOv2)的密集逐像素语义特征迁移过来,以增强MASt3R的能力。在无需引入任何辅助冻结网络的情况下,我们的模型在单次前向传播中生成逐像素语义特征并构建连贯的点图。与分别部署MASt3R和CLIP相比,我们的统一模型SAB3R在“建图与定位”基准上取得了更优的性能。此外,我们在二维语义分割和三维任务上均评估了SAB3R,以全面验证其有效性。

关键词

引用

@article{arxiv.2506.02112,
  title  = {SAB3R: Semantic-Augmented Backbone in 3D Reconstruction},
  author = {Xuweiyi Chen and Tian Xia and Sihan Xu and Jianing Yang and Joyce Chai and Zezhou Cheng},
  journal= {arXiv preprint arXiv:2506.02112},
  year   = {2025}
}

备注

3D-LLM/VLA @ CVPR2025 | Project page: https://uva-computer-vision-lab.github.io/sab3r/