一种用于机器人操作的通用语义-几何表示
机器人学
2023-10-16 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
机器人高度依赖传感器,尤其是 RGB 与深度相机,来感知并与世界交互。RGB 相机记录富含语义信息的 2D 图像,但缺失精确的空间信息。另一方面,深度相机提供关键的 3D 几何数据,但捕获的语义有限。因此,融合两种模态对于学习机器人感知与控制的表示至关重要。然而,当前研究主要聚焦于其中一种模态,忽视了结合两者的益处。为此,我们提出 ,一种面向机器人的通用感知模块,它利用大规模预训练 2D 模型的丰富语义信息,并继承 3D 空间推理的优势。我们的实验表明,SGR 使智能体成功完成多种仿真与真实世界机器人操作任务,在单任务与多任务设定下均显著优于最先进方法。此外,SGR 具备泛化至新颖语义属性的能力,使之区别于其他方法。项目主页:https://semantic-geometric-representation.github.io。
引用
@article{arxiv.2306.10474,
title = {A Universal Semantic-Geometric Representation for Robotic Manipulation},
author = {Tong Zhang and Yingdong Hu and Hanchen Cui and Hang Zhao and Yang Gao},
journal= {arXiv preprint arXiv:2306.10474},
year = {2023}
}
备注
CoRL 2023. Project website: https://semantic-geometric-representation.github.io