中文

RT-Grasp:基于多模态大型语言模型的推理调谐机器人抓取

机器人学 2024-11-11 v1

摘要

近期大型语言模型(LLM)的进展凸显了其惊人的推理能力,使其在诸多领域都具有重要影响。然而,在机器人领域,其应用主要局限于操作规划任务,因为其本构文本输出。本文旨在解决这一限制,探索 LLM 用于生成机器人任务中数值预测的潜力,具体针对机器人抓取。我们提出了推理调谐(Reasoning Tuning)方法,在训练期引入推理阶段以预测,利用 LLM 的广泛先验知识和先进推理能力。这种方法使 LLM(尤其是具有多模态能力的 LLM)能够生成准确的数值输出,如抓取姿态,这些输出具有情境感知性和可通过对话实现的可适应性。此外,我们提供了推理调谐视觉语言模型抓取数据集,精心筛选以促进 LLM 适应机器人抓取。在抓取数据集和真实世界实验中的广泛验证强调了多模态 LLM 在机器人中用于数值预测任务的可适应性。这不仅拓展了其应用范围,也弥合了基于文本的规划与直接机器人控制之间的鸿沟,从而最大化了 LLM 在机器人领域的潜力。

关键词

引用

@article{arxiv.2411.05212,
  title  = {RT-Grasp: Reasoning Tuning Robotic Grasping via Multi-modal Large Language Model},
  author = {Jinxuan Xu and Shiyu Jin and Yutian Lei and Yuqian Zhang and Liangjun Zhang},
  journal= {arXiv preprint arXiv:2411.05212},
  year   = {2024}
}

备注

Accepted to IROS 2024