Hi机器人:基于层次化视觉语言动作模型的通用开放指令跟随
机器人学
2025-07-16 v2 人工智能
机器学习
摘要
能够在开放世界环境中执行多种不同任务的通用机器人必须不仅能够推理完成目标所需的步骤,还能在任务执行期间处理复杂指令、提示甚至反馈。在本工作中,我们描述了一个系统利用视觉语言模型以层次化结构运行:首先推理复杂提示和用户反馈,以推断最合适的下一步以实现目标,然后以低层动作执行该步骤。与能够满足简单命令(如" pickup 杯子")的直接指令跟随方法不同,我们的系统能够推理复杂指令并在任务执行期间融入 Situated反馈(如"这不是垃圾")。我们在三个机器人平台上进行评估,包括单臂、双臂和双臂移动机器人,展示了其处理清理杂乱桌面、制作三明治和购物等任务的能力。视频可在 https://www.pi.website/research/hirobot 查看。
引用
@article{arxiv.2502.19417,
title = {Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models},
author = {Lucy Xiaoyang Shi and Brian Ichter and Michael Equi and Liyiming Ke and Karl Pertsch and Quan Vuong and James Tanner and Anna Walling and Haohuan Wang and Niccolo Fusai and Adrian Li-Bell and Danny Driess and Lachy Groom and Sergey Levine and Chelsea Finn},
journal= {arXiv preprint arXiv:2502.19417},
year = {2025}
}
备注
ICML 2025