中文

SparseGrasp:基于稀疏多视角RGB图像的3D语义高斯溅写抓取

机器人学 2024-12-04 v1 计算机视觉与模式识别 机器学习

摘要

语言导向的机器人抓取是一个快速发展的领域,机器人可通过人类语言指令抓取特定物体。然而,现有方法往往依赖密集摄像视角,难以快速更新场景,限制了其在可变环境中的有效性。相比之下,我们提出SparseGrasp,一个能以稀疏视角RGB图像高效运行且处理场景更新的开放词汇机器人抓取系统。该系统基于并显著增强现有机器人学习中的计算机视觉模块。具体而言,SparseGrasp利用DUSt3R生成稠密点云作为3D高斯溅写(3DGS)初始化,保持即使在稀疏监督下也能保持高保真度。重要的是,SparseGrasp整合了来自最新视觉基础模型的语义感知能力。为进一步提高处理效率,我们将主成分分析(PCA)用于压缩来自2D模型的特征。此外,我们引入一种新颖的渲染-比较策略,确保快速场景更新,使其能够在可变环境中实现多轮抓取。实验结果表明,SparseGrasp在速度和适应性方面均显著优于最先进的方法,为可变环境下的多轮抓取提供了稳健解决方案。

关键词

引用

@article{arxiv.2412.02140,
  title  = {SparseGrasp: Robotic Grasping via 3D Semantic Gaussian Splatting from Sparse Multi-View RGB Images},
  author = {Junqiu Yu and Xinlin Ren and Yongchong Gu and Haitao Lin and Tianyu Wang and Yi Zhu and Hang Xu and Yu-Gang Jiang and Xiangyang Xue and Yanwei Fu},
  journal= {arXiv preprint arXiv:2412.02140},
  year   = {2024}
}