GraspMamba:一种基于 Mamba 的语言驱动抓取检测框架与层次化特征学习
机器人学
2024-09-24 v1 计算机视觉与模式识别
摘要
抓取检测是一项基础的机器人任务,对许多工业应用的成功至关重要。然而,当前用于该任务的语言驱动模型通常在杂乱图像、冗长文本描述或缓慢的推理速度方面存在困难。我们引入了 GraspMamba,一种新的语言驱动抓取检测方法,该方法采用基于 Mamba 视觉的层次化特征融合来应对这些挑战。通过利用基于 Mamba 的骨干网络的丰富视觉特征以及文本信息,我们的方法有效增强了多模态特征的融合。GraspMamba 是首个在多个尺度上提取视觉和语言特征的基于 Mamba 的抓取检测模型,可提供稳健的性能和快速的推理时间。大量实验表明,GraspMamba 以明显的优势优于近期的方法。我们通过真实世界的机器人实验验证了我们的方法,突显了其快速的推理速度。
引用
@article{arxiv.2409.14403,
title = {GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning},
author = {Huy Hoang Nguyen and An Vuong and Anh Nguyen and Ian Reid and Minh Nhat Vu},
journal= {arXiv preprint arXiv:2409.14403},
year = {2024}
}
备注
8 pages. Project page: https://airvlab.github.io/grasp-anything/