LeVERB: 基于潜在视觉-语言指令的人形全身控制
机器人学
2025-09-26 v3 人工智能
摘要
视觉-语言-动作(VLA)模型展示了强大的语义理解和零样本泛化能力,但大多数现有系统假设具有手工设计的动作"词汇表"(如末端执行器位姿或根速度)的精确低级控制器。这一假设将先前工作限制在准静态任务中,排除了人形全身控制(WBC)任务所需的敏捷全身行为。为了弥补文献中的这一空白,我们首先提出了第一个面向 sim-to-real 的、视觉语言的、闭环的人形 WBC 基准,涵盖来自 10 个类别的 150 多个任务。然后我们提出 LeVERB:Latent Vision-Language-Encoded Robot Behavior,一种用于人形视觉语言 WBC 的分层潜在指令跟随框架,这是首个此类框架。在顶层,视觉-语言策略从合成渲染的运动学演示中学习潜在动作词汇表;在底层,强化学习的 WBC 策略消费这些潜在动词以生成动力学级命令。在我们的基准测试中,LeVERB 在简单视觉导航任务上以零样本达到 80% 的成功率,总体成功率为 58.5%,优于朴素的层次化全身 VLA 实现的 7.8 倍。
引用
@article{arxiv.2506.13751,
title = {LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction},
author = {Haoru Xue and Xiaoyu Huang and Dantong Niu and Qiayuan Liao and Thomas Kragerud and Jan Tommy Gravdahl and Xue Bin Peng and Guanya Shi and Trevor Darrell and Koushil Sreenath and Shankar Sastry},
journal= {arXiv preprint arXiv:2506.13751},
year = {2025}
}
备注
https://ember-lab-berkeley.github.io/LeVERB-Website/