中文

SPA:3D 空间感知赋能有效的具身表示

计算机视觉与模式识别 2025-03-04 v3 人工智能 机器学习 机器人学

摘要

本文介绍了 SPA,这是一种新颖的表征学习框架,强调3D空间感知在具身 AI 中的重要性。我们的方法利用多视角图像上的可微分神经渲染,为标准 Vision Transformer (ViT) 注入内在的空间理解能力。我们进行了目前最为全面的具身表征学习评估,涵盖268个任务,8个模拟器,以及单任务和语言条件化多任务场景中的多样化策略。结果令人信服:SPA 在使用更少训练数据的情况下, consistently 超过10多种最先进的表征方法,包括专为具身 AI、视觉中心任务和多模态应用设计的方法。此外,我们进行了一系列实际实验以确认其在实际场景中的有效性。这些结果凸显了3D空间感知在具身表征学习中的关键作用。我们的 strongest model 需要超过6000个 GPU 小时进行训练,我们承诺开源所有代码和模型权重,以促进具身表征学习的未来研究。项目页面:https://haoyizhu.github.io/spa/。

关键词

引用

@article{arxiv.2410.08208,
  title  = {SPA: 3D Spatial-Awareness Enables Effective Embodied Representation},
  author = {Haoyi Zhu and Honghui Yang and Yating Wang and Jiange Yang and Limin Wang and Tong He},
  journal= {arXiv preprint arXiv:2410.08208},
  year   = {2025}
}

备注

Project Page: https://haoyizhu.github.io/spa/