中文

Articulate3D:通用场景描述下的 3D 场景全面理解

计算机视觉与模式识别 2025-07-03 v2 机器人学

摘要

3D 场景理解是计算机视觉中长期存在的挑战,也是实现混合现实、可穿戴计算和具身 AI 的关键组件。提供这些应用的解决方案需要涵盖场景导向、对象导向以及交互导向等多方面的能力。虽然已有许多数据集和算法处理了前两种问题,但对于可交互和可关节对象的理解仍显得不足且仅部分覆盖于研究领域。本文通过引入:(1)Articulate3D,一个经专家精心挑选的 3D 数据集,包含 280 个室内场景的高质量手动标注。Articulate3D 提供 8 种类型的标注,用于关节对象,涵盖部件和详细运动信息,所有信息均存储在为可扩展 3D 内容创建、交换和无缝集成到仿真环境中而设计的标准化场景表示格式中。(2)USDNet,一个新型统一框架,能够同时预测关节对象的部分分割以及完整的运动属性规格。我们在 Articulate3D 上评估 USDNet,同时也在两个现有数据集上进行评估,展示了统一密集预测方法的优势。此外,我们通过跨数据集和跨域评估突显 Articulate3D 的价值,并展示其在下游任务中的可应用性,例如通过 LLM 提示进行场景编辑以及用于关节对象操作的机器人策略训练。我们提供对数据集、基准和方法源代码的开放访问。

关键词

引用

@article{arxiv.2412.01398,
  title  = {Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description},
  author = {Anna-Maria Halacheva and Yang Miao and Jan-Nico Zaech and Xi Wang and Luc Van Gool and Danda Pani Paudel},
  journal= {arXiv preprint arXiv:2412.01398},
  year   = {2025}
}