ACoT-VLA:用于视觉-语言-动作模型的动作思维链
机器人学
2026-03-31 v2
摘要
视觉-语言-动作模型已成为处理多样化操作任务的重要通用机器人策略,通常依赖于通过视觉-语言模型嵌入将多模态输入直接转化为动作。最近的进展引入了显式的中间推理——例如子任务预测(语言)或目标图像合成(视觉)——来指导动作生成。然而,这些中间推理往往是间接的,在传达精确动作执行所需的完整、细粒度信息方面存在固有的局限。相反,我们认为最有效的推理形式是直接在动作空间中进行思考。我们引入了动作思维链(ACoT),一种将推理过程本身表述为引导最终策略的粗略动作意图的结构化序列的范式。在本文中,我们提出了ACoT-VLA,一种实现ACoT范式的新架构。具体而言,我们引入了两个互补的组件:显式动作推理器(EAR)和隐式动作推理器(IAR)。前者提出粗略参考轨迹作为显式的动作级推理步骤,而后者从多模态输入的内部表示中提取潜在动作先验,共同构成一个ACoT,对下游动作头进行条件化,以实现有根据的策略学习。在真实世界和仿真环境中进行的广泛实验证明了我们提出方法的优越性。代码获取地址:https://github.com/AgibotTech/ACoT-VLA。
关键词
引用
@article{arxiv.2601.11404,
title = {ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models},
author = {Linqing Zhong and Yi Liu and Yifei Wei and Ziyu Xiong and Maoqing Yao and Si Liu and Guanghui Ren},
journal= {arXiv preprint arXiv:2601.11404},
year = {2026}
}
备注
Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026