中文

TGSFormer:用于具身语义场景完成的可扩展时序高斯溅射

计算机视觉与模式识别 2025-12-02 v1

摘要

具身三维语义场景完成(SSC)从连续的自我观察中推断稠密几何和语义信息。大多数现有基于高斯的方法依赖于在预定义空间边界内随机初始化大量原始图形,导致冗余且难以扩展到无界场景。最近的深度导向方法缓解了这一问题,但仍是局部的,随着规模增大会产生延迟和内存开销。为克服这些挑战,我们提出了 TGSFormer,一个用于具身 SSC 的可扩展时序高斯溅射框架。它维护持久的高斯记忆用于时序预测,不依赖图像一致性或帧缓存。对于时序融合,双时序编码器通过置信感知的交叉注意力处理当前和历史高斯特征。随后,置信感知的体素融合模块将重叠原始图形合并为体素对齐表示,调节密度并保持紧凑性。广泛的实验表明,TGSFormer 在本地和具身 SSC 基准上实现了最先进的成绩,同时以显著更少的原始图形实现更高的精度和可扩展性,保持一致的长期场景完整性。代码将在接受后公开。

关键词

引用

@article{arxiv.2512.00300,
  title  = {TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion},
  author = {Rui Qian and Haozhi Cao and Tianchen Deng and Tianxin Hu and Weixiang Guo and Shenghai Yuan and Lihua Xie},
  journal= {arXiv preprint arXiv:2512.00300},
  year   = {2025}
}

备注

14 pages, 10 figures