中文

HMT-Grasp:一种用于密集环境机器人抓取的混合Mamba-Transformer方法

机器人学 2025-03-11 v2

摘要

机器人抓取无论是处理孤立物体、杂乱物品还是堆叠物品,都是工业和服务应用中的关键问题。然而,当前基于卷积神经网络(CNN)和视觉Transformer(ViT)的视觉抓取检测方法往往难以适应多样化场景,因为它们倾向于专注于局部或全局特征,忽略了互补线索。在本文中,我们提出一种新型混合Mamba-Transformer方法以解决上述挑战。该方法通过集成视觉Mamba和平行卷积-Transformer模块,有效捕获全局和局部信息。这种混合架构显著提高了在各种机器人任务中的适应性、精度和灵活性。为确保公平评估,我们在Cornell、Jacquard和OCID-Grasp数据集上进行了大量实验,涵盖从简单到复杂的场景。此外,我们进行了仿真和实际机器人实验。结果表明,该方法不仅在标准抓取数据集上超越了最先进的技术,还在仿真和实际机器人应用中 delivers strong performance。

关键词

引用

@article{arxiv.2410.03522,
  title  = {HMT-Grasp: A Hybrid Mamba-Transformer Approach for Robot Grasping in Cluttered Environments},
  author = {Songsong Xiong and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2410.03522},
  year   = {2025}
}