中文

SURPRISE3D:复杂 3D 场景中空间理解与推理的数据集

计算机视觉与模式识别 2025-07-11 v1 机器人学

摘要

将语言与 3D 感知集成是实现具身 AI 和机器人系统感知、理解并与物理世界交互的关键。空间推理作为理解对象之间空间关系的关键能力,在当前 3D 视觉-语言研究中仍受到忽视。现有数据集常将语义线索(如对象名称)与空间上下文混合,导致模型依赖于浅层捷径而非对空间关系进行真正的解释。为此,我们引入 S\textsc{urprise}3D,一个旨在评估复杂 3D 场景中语言引导的空间推理分割的数据集。S\textsc{urprise}3D 包含超过 20 万个视觉-语言对,涵盖 900+ 个详尽的室内场景(来自 ScanNet++ v2),包括 2800+ 个独特对象类别。数据集包含 8.9 万+ 人类标注的空间查询,这些查询专为无对象名称而设计,从而缓解空间理解中的捷径偏置。这些查询全面覆盖各种空间推理技能,包括相对位置、叙事视角、参数视角和绝对距离推理。初始基准显示,当前最先进的 3D 视觉 grounding 方法和 3D-LLM 在这些任务上面临重大挑战,凸显了本数据集及其随附的 3D 空间推理分割 (3D-SRS) 基准套件的必要性。S\textsc{urprise}3D 和 3D-SRS 旨在推动空间感知 AI 的发展,为有效的具身交互和机器人规划铺平道路。代码和数据集可在 https://github.com/liziwennba/SUPRISE 查找。

关键词

引用

@article{arxiv.2507.07781,
  title  = {SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes},
  author = {Jiaxin Huang and Ziwen Li and Hanlve Zhang and Runnan Chen and Xiao He and Yandong Guo and Wenping Wang and Tongliang Liu and Mingming Gong},
  journal= {arXiv preprint arXiv:2507.07781},
  year   = {2025}
}