中文

S2GS:面向在线场景理解与重建的流式语义高斯溅

计算机视觉与模式识别 2026-03-17 v1

摘要

现有的离线前馈方法用于处理长图像序列上的联合场景理解与重建,常常在不断增长的过去观测集合上重复进行全局计算,导致运行时和 GPU 内存随序列长度快速增长,限制了可扩展性。我们提出流式语义高斯溅 (S2GS),一个严格因果的、增量式 3D 高斯语义场框架:它不依赖未来帧,持续更新场景的几何、外观和实例级语义,而无需重新处理历史帧,实现可扩展的在线联合重建与理解。S2GS 采用几何-语义解耦的双主干设计:几何主干执行因果建模以驱动增量高斯更新,而语义主干利用 2D 基础视觉模型和查询驱动的解码器预测分割掩码和身份嵌入,进一步通过查询级别的对比对齐和轻量级在线关联与实例记忆实现稳定。实验表明,S2GS 在联合重建与理解基准上与或优于强大的离线基线,同时显著提升了长期规模性:它处理 1000 多帧的运行时和 GPU 内存增长远慢于离线全局处理基线,后者在相同设置下通常在约 80 帧时就会耗尽内存。

关键词

引用

@article{arxiv.2603.14232,
  title  = {S2GS: Streaming Semantic Gaussian Splatting for Online Scene Understanding and Reconstruction},
  author = {Renhe Zhang and Yuyang Tan and Jingyu Gong and Zhizhong Zhang and Lizhuang Ma and Yuan Xie and Xin Tan},
  journal= {arXiv preprint arXiv:2603.14232},
  year   = {2026}
}

备注

10 pages, 7 figures