中文

SemGS:稀疏视角下的通用语义 3D 高斯渲染

计算机视觉与模式识别 2026-03-04 v1

摘要

3D 场景的语义理解对机器人在复杂环境中有效和安全地运行至关重要。现有方法的语义场景重建和语义感知的新视角合成往往依赖稠密多视角输入,并需要场景特定的优化,限制了其在实际应用中的实用性和可扩展性。为此,我们提出了 SemGS,一个从稀疏图像输入重建通用语义场的前馈框架。SemGS 使用双分支架构提取颜色和语义特征,两个分支共享浅层 CNN 层,使语义推理能够利用颜色外观中的纹理和结构线索。我们还将相机感知注意力机制集成到特征提取器中,以显式建模相机视点之间的几何关系。提取的特征被解码为双高斯,几何一致性得以保持,同时保留分支特有的属性,进一步光栅化以合成新视角下的语义图。此外,我们引入了区域平滑损失以增强语义连贯性。实验表明,SemGS 在基准数据集上实现了最佳性能,同时提供了快速推理和强大的跨场景泛化能力,涵盖多种合成和真实场景。

关键词

引用

@article{arxiv.2603.02548,
  title  = {SemGS: Feed-Forward Semantic 3D Gaussian Splatting from Sparse Views for Generalizable Scene Understanding},
  author = {Sheng Ye and Zhen-Hui Dong and Ruoyu Fan and Tian Lv and Yong-Jin Liu},
  journal= {arXiv preprint arXiv:2603.02548},
  year   = {2026}
}

备注

ICRA 2026