GraspMolmo:通过大规模合成数据生成实现可泛化的任务导向抓取
机器人学
2025-09-16 v3
摘要
我们提出了GraspMolmo,一个可泛化的开放词汇任务导向抓取(TOG)模型。GraspMolmo根据自然语言指令和单张RGB-D帧预测语义合适且稳定的抓取。例如,给定"给我倒些茶",GraspMolmo会选择在茶壶把手而非壶身上抓取。与先前的TOG方法不同——后者受限于小规模数据集、简单语言和无杂乱场景——GraspMolmo从PRISM中学习,这是一个新颖的大规模合成数据集,包含379k个样本,特征是杂乱环境和多样化、真实的任务描述。我们在此数据上微调Molmo视觉-语言模型,使GraspMolmo能够泛化到新颖的开放词汇指令和物体。在具有挑战性的真实世界评估中,GraspMolmo取得了最先进的结果,在复杂任务上达到70%的预测成功率,而次优替代方法仅为35%。GraspMolmo还成功展示了零样本预测语义正确的双手抓取的能力。我们发布合成数据集、代码、模型和基准,以加速任务语义机器人操作领域的研究,这些内容连同视频可在 https://abhaybd.github.io/GraspMolmo/ 获取。
引用
@article{arxiv.2505.13441,
title = {GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation},
author = {Abhay Deshpande and Yuquan Deng and Arijit Ray and Jordi Salvador and Winson Han and Jiafei Duan and Kuo-Hao Zeng and Yuke Zhu and Ranjay Krishna and Rose Hendrix},
journal= {arXiv preprint arXiv:2505.13441},
year = {2025}
}