中文

Fast-in-Slow:在慢速推理中统一快速操作的 Dual-System 基础模型

机器人学 2025-06-03 v1

摘要

通用策略与执行效率是机器人操作中的两大关键挑战。近期的基础策略受益于互联网规模预训练视觉语言模型 (VLMs) 的常识推理能力,但常受限于低执行频率。为缓解这一困境,受 Kahneman 理论启发,人们提出了 dual-system 方法,利用基于 VLM 的 System 2 模型处理高层推理,并利用独立的 System 1 动作模型确保实时控制。然而,现有设计将两个系统维持为独立模型,限制了 System 1 充分利用基于 VLM 的 System 2 中丰富的预训练知识。本文提出 Fast-in-Slow (FiS),一种统一的 dual-system 视觉语言动作 (VLA) 模型,通过部分参数共享将 System 1 执行模块嵌入基于 VLM 的 System 2 中。这一创新范式不仅使 System 1 具备高频执行能力,还促进了 System 2 单一基础模型内推理与执行组件间的协调。鉴于其在 FiS-VLA 中具有根本不同的角色,我们设计了两个系统以结合异构模态输入与异步运行频率,从而实现快速且精确的操作。为实现两系统间的协调,提出了一种 dual-aware co-training 策略,在保留 System 2 上下文推理表示的同时,赋予 System 1 动作生成能力。在评估中,FiS-VLA 在仿真和真实世界任务中的平均成功率分别比先前 state-of-the-art 方法高出 8% 和 11%,同时在 action chunk 设为 8 时实现了 117.7 Hz 的控制频率。项目网页:fast-in-slow.github.io。

关键词

引用

@article{arxiv.2506.01953,
  title  = {Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning},
  author = {Hao Chen and Jiaming Liu and Chenyang Gu and Zhuoyang Liu and Renrui Zhang and Xiaoqi Li and Xiao He and Yandong Guo and Chi-Wing Fu and Shanghang Zhang and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2506.01953},
  year   = {2025}
}