Being-0:具备视觉语言模型和模块化技能的人形机器人智能体
机器人学
2025-05-13 v2 机器学习
摘要
实现在真实世界具身任务中达到人类水平性能的人形机器人智能体是人形机器人研究的最终目标。近期进展在高级认知方面取得了显著进展,并为人形机器人开发低级技能。然而,直接将这些组件组合通常会导致鲁棒性和效率差异,由于在长期任务中的误差叠加以及不同模块的延迟差异。我们引入 Being-0,一个层次化的智能体框架,将 FM 与模块化技能库集成。FM 处理高级认知任务,如指令理解、任务规划和推理,而技能库提供稳定的 locomotion 和灵巧操作控制。为弥合两者之间的差距,我们提出了一种新的 Connector 模块,由轻量级视觉语言模型(VLM)驱动。Connector 通过将基于语言的计划翻译为可执行技能命令,并动态协调 locomotion 和操作,提高任务成功率。通过所有组件(除 FM 外)可部署在低成本的 onboard 计算设备上,Being-0 在配备灵巧手臂和主动视觉的全身人形机器人上实现了高效的实时性能。大规模室内环境中的广泛实验表明,Being-0 在解决需要挑战性导航和操作子任务的复杂长期任务方面有效。了解更多详情和视频,请访问 https://beingbeyond.github.io/Being-0。
引用
@article{arxiv.2503.12533,
title = {Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills},
author = {Haoqi Yuan and Yu Bai and Yuhui Fu and Bohan Zhou and Yicheng Feng and Xinrun Xu and Yi Zhan and Börje F. Karlsson and Zongqing Lu},
journal= {arXiv preprint arXiv:2503.12533},
year = {2025}
}