Polaris:通过 Syn2Real 视觉定位与大语言模型实现开放式交互机器人操控
机器人学
2024-08-16 v1 计算与语言
计算机视觉与模式识别
摘要
本文研究了桌面场景中的开放式交互机器人操控任务。尽管近期大语言模型(LLM)增强了机器人对用户指令的理解,但其缺乏视觉定位能力限制了其与物理环境进行交互的能力。这是因为机器人需要在物理工作空间内定位目标操控对象。为此,我们提出了一种名为 Polaris 的交互式机器人操控框架,通过结合 GPT-4 和定位视觉模型来整合感知与交互。为了实现精确操控,定位视觉模型需要为目标对象生成详细的位姿信息,而不仅仅是识别图像中属于它们的像素。因此,我们提出了一种新颖的合成到真实(Syn2Real)位姿估计流水线。该流水线利用渲染的合成数据进行训练,然后迁移到真实世界的操控任务中。真实世界的性能验证了所提出流水线的有效性,并强调了其扩展到更通用类别的潜力。此外,真实机器人实验展示了我们框架在抓取和执行多项操控任务中的出色表现。这表明其有望泛化到桌面场景之外的环境。更多信息和视频结果请访问:https://star-uu-wang.github.io/Polaris/
引用
@article{arxiv.2408.07975,
title = {Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models},
author = {Tianyu Wang and Haitao Lin and Junqiu Yu and Yanwei Fu},
journal= {arXiv preprint arXiv:2408.07975},
year = {2024}
}
备注
Accepted by IROS 2024. 8 pages, 5 figures. See https://star-uu-wang.github.io/Polaris/