面向开放世界的三维场景图的关节 articulation
机器人学
2026-02-19 v1 人工智能
计算机视觉与模式识别
摘要
语义化已使 3D 场景理解和基于可 affordance 的对象交互成为可能。然而,正在真实环境中运行的机器人面临一个关键限制:它们无法预见对象如何移动。长期间的移动操作需要在语义、几何和运动学之间架起桥梁。本文提出了 MoMa-SG,一个用于构建包含众多可交互对象的 articulation 场景的语义-运动学 3D 场景图的新型框架。给定包含多个对象 articulation 的 RGB-D 序列,我们对对象交互进行时间分段,并通过基于遮挡鲁棒的点跟踪推断对象运动。随后,我们将点轨迹提升至 3D 空间,并通过一种新颖的统一扭量估计公式来估计 articulation 模型,该公式能够在单一优化步骤中稳健地估计螺旋关和棱柱关的关节点参数。接着,我们将对象与估计的 articulation 关联,并通过推理在识别到的开启状态下的父子关系来检测被包含的对象。我们还引入了新颖的 Arti4D-Semantic 数据集,其独特之处在于将层次化对象语义(包括父子关系标签)与对象轴标注相结合,涵盖 62 个真实场景的 RGB-D 序列,其中包含 600 多个对象交互和三种不同的观察范式。我们对 MoMa-SG 在两个数据集上的性能进行了广泛评估,并对方法的关键设计进行了消融实验。此外,实验在四足机器人和移动机械臂上表明,语义-运动学场景图使我们能够在日常家庭环境中对 articulation 对象进行稳健的操作。我们提供代码和数据:https://momasg.cs.uni-freiburg.de。
引用
@article{arxiv.2602.16356,
title = {Articulated 3D Scene Graphs for Open-World Mobile Manipulation},
author = {Martin Büchner and Adrian Röfer and Tim Engelbracht and Tim Welschehold and Zuria Bauer and Hermann Blum and Marc Pollefeys and Abhinav Valada},
journal= {arXiv preprint arXiv:2602.16356},
year = {2026}
}