WALL-E:基于大语言模型的具身机器人服务员负载抓取
机器人学
2023-09-01 v2 人工智能
摘要
使机器人理解语言指令并相应地对视觉感知做出反应一直是机器人研究界的长期目标。实现该目标需要自然语言处理、计算机视觉和机器人工程学的前沿进展。因此,本文主要研究集成最新大语言模型(LLMs)与现有视觉 grounding 和机器人抓取系统以增强人机交互有效性的潜力。我们引入WALL-E(基于大语言模型的具身机器人服务员负载抓取)作为该集成的一个示例。该系统利用ChatGPT的LLM通过多轮交互对话将用户的偏好对象总结为目标指令。目标指令随后被转发至视觉 grounding 系统用于物体位姿和尺寸估计,之后机器人相应地抓取物体。我们将该LLM赋能的系统部署在物理机器人上,为指令引导抓取任务提供更友好的用户界面。在各种真实场景下的进一步实验结果证明了我们提出框架的可行性与有效性。参见项目网站:https://star-uu-wang.github.io/WALL-E/
引用
@article{arxiv.2308.15962,
title = {WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model},
author = {Tianyu Wang and Yifan Li and Haitao Lin and Xiangyang Xue and Yanwei Fu},
journal= {arXiv preprint arXiv:2308.15962},
year = {2023}
}
备注
14 pages, 8 figures. See https://star-uu-wang.github.io/WALL-E/