LoHoVLA:用于长周期具身任务的统一视觉-语言-动作模型
机器人学
2025-06-03 v1 人工智能
摘要
现实世界中的具身智能体面临着长周期任务,这些任务具有需要超越单一动作的多步解决方案的高级目标。成功应对这些任务需要高级任务规划(即将目标分解为子任务)和低级运动控制(即生成精确的机器人动作)。虽然现有的视觉-语言-动作 (VLA) 模型和分层架构在具身任务中具有潜力,但前者在规划方面常常表现不佳,而后者可能存在协调问题,两者都阻碍了性能。我们引入了一个用于长周期任务的全新统一 VLA 框架,称为 LoHoVLA,以克服这些局限性。LoHoVLA 利用大型预训练视觉-语言模型 (VLM) 作为骨干,分别联合生成用于子任务生成的语言 token 和用于机器人动作预测的动作 token。这种共享表示促进了跨任务的更好泛化。此外,LoHoVLA 采用分层闭环控制机制,以减轻源自高级规划和低级控制的误差。为了训练 LoHoVLA,我们引入了 LoHoSet,这是一个基于 Ravens 模拟器构建的数据集,包含 20 个长周期任务,每个任务有 1,000 个由视觉观察、语言目标、子任务和机器人动作组成专家演示。实验结果表明,在 Ravens 模拟器中的长周期具身任务上,LoHoVLA 显著超越了分层和标准 VLA 方法。这些发现凸显了统一架构在推进可泛化具身智能方面的前景。
关键词
引用
@article{arxiv.2506.00411,
title = {LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks},
author = {Yi Yang and Jiaxuan Sun and Siqi Kou and Yihan Wang and Zhijie Deng},
journal= {arXiv preprint arXiv:2506.00411},
year = {2025}
}