基于自由形式语言的机器人推理与抓取
机器人学
2025-07-29 v2 人工智能
计算机视觉与模式识别
摘要
根据人类指令从杂乱箱体中执行机器人抓取是一项具有挑战性的任务,因为它需要同时理解自由形式语言的细微差别以及物体之间的空间关系。在网页规模数据上训练的视觉语言模型(VLMs),如 GPT-4o,在文本和图像方面展现出了卓越的推理能力。但它们能否真正在零样本设置下用于此任务?其局限性又是什么?本文通过基于自由形式语言的机器人抓取任务探索这些研究问题,并提出了一种新方法 FreeGrasp,利用预训练 VLM 的世界知识来推理人类指令和物体空间排列。该方法将所有物体检测为关键点,并使用这些关键点在图像上标注标记,旨在促进 GPT-4o 的零样本空间推理。这使得该方法能够确定所请求的物体是否可以直接抓取,或者是否必须先抓取并移除其他物体。由于目前没有专门为此任务设计的数据集,我们通过扩展 MetaGraspNetV2 数据集并加入人工标注的指令和真实抓取序列,引入了一个合成数据集 FreeGraspData。我们在 FreeGraspData 上进行了广泛分析,并使用配备夹爪的机械臂进行了真实世界验证,展示了在抓取推理和执行方面的最先进性能。项目网站:https://tev-fbk.github.io/FreeGrasp/。
引用
@article{arxiv.2503.13082,
title = {Free-form language-based robotic reasoning and grasping},
author = {Runyu Jiao and Alice Fasoli and Francesco Giuliari and Matteo Bortolon and Sergio Povoli and Guofeng Mei and Yiming Wang and Fabio Poiesi},
journal= {arXiv preprint arXiv:2503.13082},
year = {2025}
}
备注
Accepted to IROS 2025. Project website: https://tev-fbk.github.io/FreeGrasp/