中文

UniSem:从稀疏未定位图像进行通用语义 3D 重建

计算机视觉与模式识别 2026-03-19 v1

摘要

从稀疏、未定位图像进行语义感知的 3D 重建在面向 feed-forward 的 3D 高斯溅射 (3DGS) 方法中仍具有挑战性。现有方法常在稀疏视图监督下预测过完整的高斯原始集合,导致几何不稳定且深度质量较差。同时,它们仅依赖 2D 分割器特征进行语义提升,提供的 3D 级别和有限的可泛化监督导致在新场景中 3D 语义不完整。为此,本文提出 UniSem,一个统一框架,通过两个关键组件联合提升深度精度和语义泛化。第一,误差感知的高斯 Dropout (EGD) 通过抑制基于渲染误差线索的冗余高斯,产生具有意义且几何稳定的高斯表示,从而改善深度估计。第二,引入混合训练课程 (MTC),逐步融合 2D 分割器提升的语义与模型自身新兴的 3D 语义先验,通过对象级原型对齐增强语义连贯性和完整性。在 ScanNet 和 Replica 上的大量实验表明,UniSem 在不同输入视图数量下在深度预测和开放词汇 3D 分割方面均表现优异。值得注意的是,与强大基线相比,UniSem 在 16 视图输入下将深度 Rel 降低 15.2%,并将开放词汇分割 mAcc 提升 3.7%。

关键词

引用

@article{arxiv.2603.17519,
  title  = {UniSem: Generalizable Semantic 3D Reconstruction from Sparse Unposed Images},
  author = {Guibiao Liao and Qian Ren and Kaimin Liao and Hua Wang and Zhi Chen and Luchao Wang and Yaohua Tang},
  journal= {arXiv preprint arXiv:2603.17519},
  year   = {2026}
}