面向长期场景理解与定位的动态3D高斯场景图
计算机视觉与模式识别
2026-05-29 v1 机器人学
摘要
将开放词汇语义信息整合到动态3D场景表示中,对长期具身化场景理解至关重要。然而,现有方法常因跨视图线索不完整而导致实例关联脆弱,同时其有限的处理对象级拓扑变化能力限制了长期机器人任务执行。此外,当前3D场景理解方法要么依赖简单特征匹配而缺乏显式空间推理,要么假设离线真值3D几何。为此,我们提出DGSG-Mind,一种基于具身推理智能体的混合实例感知3D高斯动态场景图系统。系统将概率体素网格与显式3D高斯耦合,实现稳健的跨模态实例融合和增量语义映射。通过基于高斯的视觉重定位和几何-语义一致性引导的局部遮蔽细化,处理动态变化。基于实例高斯图,DGSG-Mind进一步构建层次化场景图,开发3D高斯心智,集成结构关系、空间-语义信息及视觉标注ROI高斯渲染,用于多模态推理。大量实验表明,DGSG-Mind在自重建地图上实现了最佳零样本3D场景图性能,同时在3D开放词汇语义分割和场景重建中表现优异。我们还在真实机器人上部署DGSG-Mind,展示其目标导向推理与动态更新能力。项目页面可访问https://icr-lab.github.io/DGSG-Mind
引用
@article{arxiv.2605.29879,
title = {DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding},
author = {Luzhou Ge and Xiangyu Zhu and Jinyan Liu and Xuesong Li},
journal= {arXiv preprint arXiv:2605.29879},
year = {2026}
}
备注
9 pages, 6 figures