中文

一种用于机器人操作的通用语义-几何表示

机器人学 2023-10-16 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

机器人高度依赖传感器,尤其是 RGB 与深度相机,来感知并与世界交互。RGB 相机记录富含语义信息的 2D 图像,但缺失精确的空间信息。另一方面,深度相机提供关键的 3D 几何数据,但捕获的语义有限。因此,融合两种模态对于学习机器人感知与控制的表示至关重要。然而,当前研究主要聚焦于其中一种模态,忽视了结合两者的益处。为此,我们提出 Semantic-Geometric Representation(SGR)\textbf{Semantic-Geometric Representation} (\textbf{SGR}),一种面向机器人的通用感知模块,它利用大规模预训练 2D 模型的丰富语义信息,并继承 3D 空间推理的优势。我们的实验表明,SGR 使智能体成功完成多种仿真与真实世界机器人操作任务,在单任务与多任务设定下均显著优于最先进方法。此外,SGR 具备泛化至新颖语义属性的能力,使之区别于其他方法。项目主页:https://semantic-geometric-representation.github.io。

关键词

引用

@article{arxiv.2306.10474,
  title  = {A Universal Semantic-Geometric Representation for Robotic Manipulation},
  author = {Tong Zhang and Yingdong Hu and Hanchen Cui and Hang Zhao and Yang Gao},
  journal= {arXiv preprint arXiv:2306.10474},
  year   = {2023}
}

备注

CoRL 2023. Project website: https://semantic-geometric-representation.github.io