SNOW:面向开放世界具身推理的时空场景理解与世界知识
计算机视觉与模式识别
2025-12-19 v1 机器人学
摘要
自主机器人系统需要对动态环境进行时空理解,以确保可靠的导航和交互。虽然视觉-语言模型(VLMs)提供了开放世界的语义先验,但它们缺乏对3D几何和时间动力学的grounding。相反,几何感知捕捉结构和运动,但在语义上仍然稀疏。我们提出了SNOW(Scene Understanding with Open-World Knowledge),一个无需训练且与骨干网络无关的框架,用于统一的4D场景理解,它将VLM导出的语义与点云几何和时间一致性相结合。SNOW处理同步的RGB图像和3D点云,使用HDBSCAN聚类生成目标级提案,以引导SAM2分割。每个分割区域通过我们提出的时空标记化补丁编码(STEP)进行编码,生成捕捉局部语义、几何和时间属性的多模态标记。这些标记被增量地整合到4D场景图(4DSG)中,作为下游推理的4D先验。一个轻量级SLAM后端将所有STEP标记在环境中进行空间锚定,提供全局参考对齐,并确保跨时间的明确空间grounding。结果的4DSG形成了一个可查询的统一世界模型,VLMs可以通过它直接解释空间场景结构和时间动力学。在多样化基准上的实验表明,SNOW实现了精确的4D场景理解和空间grounding推理,从而在多个设置中建立了新的最先进性能,突出了结构化4D先验对具身推理和自主机器人学的重要性。
引用
@article{arxiv.2512.16461,
title = {SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning},
author = {Tin Stribor Sohn and Maximilian Dillitzer and Jason J. Corso and Eric Sax},
journal= {arXiv preprint arXiv:2512.16461},
year = {2025}
}