中文

通过空间导向合成世界实现机器人仿身认知

人工智能 2025-05-21 v1 机器人学

摘要

我们提出一种用于训练视觉-语言模型 (VLM) 执行视觉视角推断 (VPT) 的概念框架,VPT是仿身认知中至关重要的能力,对人机交互 (HRI) 至关重要。作为实现这一目标的第一步,我们引入了一个合成数据集,由 NVIDIA Omniverse 生成,支持空间推理任务的监督学习。每个实例包括 RGB 图像、自然语言描述以及表示物体姿态的 4X4 变换矩阵的ground-truth。我们聚焦于推断 Z 轴距离作为基础技能,未来工作将针对完整 6 自由度 (DOF) 推理进行扩展。该数据集已公开,以支持进一步的研究。本工作是仿身 AI 系统在交互式人机情境中具备空间理解能力的基础性步骤。

关键词

引用

@article{arxiv.2505.14366,
  title  = {Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds},
  author = {Joel Currie and Gioele Migno and Enrico Piacenti and Maria Elena Giannaccini and Patric Bach and Davide De Tommaso and Agnieszka Wykowska},
  journal= {arXiv preprint arXiv:2505.14366},
  year   = {2025}
}

备注

Accepted to: Intelligent Autonomous Systems (IAS) 2025 as Late Breaking Report