中文

EgoSplat:基于语言嵌入 3D 高斯泼溅的开放词汇自我中心场景理解

计算机视觉与模式识别 2025-03-17 v1

摘要

与典型的场景理解任务相比,自我中心场景表现出频繁的遮挡、多变的视角和动态交互。遮挡和多变的视角会导致多视角语义不一致,而动态物体可能作为瞬态干扰因素,在语义特征建模中引入伪影。为了应对这些挑战,我们提出 EgoSplat,一个用于开放词汇自我中心场景理解的语言嵌入 3D 高斯泼溅框架。我们设计了一种多视角一致的实例特征聚合方法,利用 SAM2 的分割与跟踪能力,为每个实例跨视角选择性地聚合互补特征,确保场景的精确语义表示。此外,我们构建了一个实例感知的时空瞬态预测模块,通过整合跨多视角实例的时空关联来提升预测中的空间完整性和时间连续性,有效减少自我中心场景语义重建中的伪影。EgoSplat 在两个数据集的定位和分割任务上均取得了 SOTA 性能,在 ADT 数据集上定位准确率提升 8.2%,分割 mIoU 提升 3.7%,超越了现有方法,并在开放词汇自我中心场景理解中树立了新的基准。代码将公开发布。

关键词

引用

@article{arxiv.2503.11345,
  title  = {EgoSplat: Open-Vocabulary Egocentric Scene Understanding with Language Embedded 3D Gaussian Splatting},
  author = {Di Li and Jie Feng and Jiahao Chen and Weisheng Dong and Guanbin Li and Guangming Shi and Licheng Jiao},
  journal= {arXiv preprint arXiv:2503.11345},
  year   = {2025}
}