中文

HALO:一种用于具身多模态链路思考推理的统一视觉语言动作模型

机器人学 2026-03-02 v2

摘要

视觉语言动作 (Vision-Language-Action, VLA) 模型在机器人操作中表现出强大的性能,但由于缺乏对多模态推理和行动下世界演变的显式机制,往往在长期视角或分布外场景中难以应对。近期研究在 VLA 模型中引入文本链路思考或视觉子目标预测以进行推理,但仍未能提供一种统一的人类化推理框架,以实现文本推理、视觉前瞻和动作预测的联合。为此,我们提出 HALO,一种统一的 VLA 模型,通过文本任务推理、视觉子目标预测(用于细粒度指导)以及 HALO 增强的动作预测三个顺序步骤,实现具身多模态链路思考 (embodied multimodal chain-of-thought, EM-CoT) 推理。我们采用 Mixture-of-Transformers (MoT) 架构实现 HALO,将语义推理、视觉前瞻和动作预测解耦为专门的专家,同时实现无缝的跨专家协作。为使 HALO 能够大规模学习,我们引入一个自动化管道来合成 EM-CoT 训练数据,并设计了精心策划的训练配方。广泛的实验表明:(1) HALO 在模拟和真实环境中均实现了优异性能,在 RoboTwin 基准中超越基线策略 pi_0 34.1%;(2) 训练配方和 EM-CoT 设计的所有提议组件都有助于提高任务成功率;(3) HALO 在我们提出的 EM-CoT 推理下,表现出对激进的未知环境随机化的强大泛化能力。

关键词

引用

@article{arxiv.2602.21157,
  title  = {HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning},
  author = {Quanxin Shou and Fangqi Zhu and Shawn Chen and Puxin Yan and Zhengyang Yan and Yikun Miao and Xiaoyi Pang and Zicong Hong and Ruikai Shi and Hao Huang and Jie Zhang and Song Guo},
  journal= {arXiv preprint arXiv:2602.21157},
  year   = {2026}
}