面向全身机器人操纵的异步快慢视觉语言-动作策略
机器人学
2025-12-24 v1 人工智能
摘要
大多数视觉语言-动作 (VLA) 系统将视觉语言模型 (VLM) 用于语义推理,同时集成产生连续动作信号的动作专家,但二者通常以单一统一频率运行。结果是,策略性能受大型 VLM 推理速度的制约。这种强制同步执行严重限制了全身机器人操纵的控制稳定性和实时性能,而该任务涉及更多关节、更大的运动空间以及动态变化的视角。我们引入一种真正异步的 Fast-Slow VLA 框架 (DuoCore-FS),将系统组织为用于高频动作生成的快路径,以及用于丰富 VLM 推理的慢路径。该系统具有两个关键特征。首先,潜在表示缓冲区桥接慢速和快速系统。它存储与场景-指令上下文对齐的指令语义和动作-推理表示,为快速路径提供高层指导。其次,全身动作标记器提供全身动作的紧凑、统一表示。重要的是,VLM 与动作专家仍然进行端到端联合训练,保持统一的策略学习,同时实现异步执行。DuoCore-FS 支持 3B 参数的 VLM,实现 30 Hz 的全身动作块生成,约为先前规模相当的 VLA 模型的三倍。真实世界的全身操纵实验表明,与同步 Fast-Slow VLA 基线相比,DuoCore-FS 在任务成功率和响应性方面均取得了改善。DuoCore-FS 的实现,包括训练、推理和部署,已由Astribot 提供给商业用户,作为Astribot 机器人平台的一部分。
关键词
引用
@article{arxiv.2512.20188,
title = {Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation},
author = {Teqiang Zou and Hongliang Zeng and Yuxuan Nong and Yifan Li and Kehui Liu and Haotian Yang and Xinyang Ling and Xin Li and Lianyang Ma},
journal= {arXiv preprint arXiv:2512.20188},
year = {2025}
}