感知与动作统一:一种带隐式视觉链式思维的混合模态管线用于机器人动作生成
机器人学
2026-01-30 v2
摘要
基于链式思维 (CoT) 构建的视觉-语言-动作 (VLA) 模型在推进通用机器人智能体方面取得了显著进展,这得益于其强大的感知理解能力。最近,由于文本-only CoT 难以充分捕捉复杂空间环境中的场景细节,一种高度有前景的策略是利用视觉先验来指导机器人动作生成。然而,这些策略面临两个内在挑战:(i) 视觉观察与低层动作之间的模态鸿沟,以及 (ii) 由于视觉预测与动作生成目标的竞争而导致的训练不稳定。为解决这些挑战,我们提出了一种视觉整合轨迹对齐 (VITA) 框架,该框架在视觉和动作之间学习共享的离散潜空间,从而实现感知和运动控制的联合建模。VITA 引入一种隐式视觉 CoT: autoregressively 解码的标记同时解码为未来帧预测和机器人动作,从而将视觉动力学内在化为运动规划的归纳偏置。在模拟和真实环境中的广泛实验表明,VITA 在 CALVIN、LIBERO 和 SimplerEnv 上的绩效均显著优于现有基线。VITA 在 CALVIN、LIBERO 和 SimplerEnv 上的性能分别提高了 14.5%、9.6% 和 12.1%。此外,VITA 在六个真实世界任务中实现了 80.5% 的平均成功率,表明其作为通用机器人操作模型的潜力。
引用
@article{arxiv.2511.19859,
title = {Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation},
author = {Xiangkai Ma and Lekai Xing and Han Zhang and Wenzhong Li and Sanglu Lu},
journal= {arXiv preprint arXiv:2511.19859},
year = {2026}
}