LaST$_{0}$:用于机器人视觉-语言-动作模型的潜在时空思维链
机器人学
2026-03-31 v3
摘要
视觉-语言-动作 (VLA) 模型最近展现出了强大的泛化能力,一些方法试图在执行前显式生成语言推理轨迹或预测未来观测。然而,显式推理通常会产生不可忽略的推理延迟,这限制了机器人操作所需的时间分辨率。此外,这种推理局限于语言空间,造成了表征瓶颈,难以忠实捕捉难以言喻的物理属性。为了缓解这些局限性,我们提出了 LaST,这是一个通过潜在时空思维链 (CoT) 在行动前实现高效推理的框架,能够捕捉通常难以用语言表达的细粒度物理和机器人动力学。具体而言,我们引入了一个 token 高效的潜在 CoT 空间,对未来的视觉动力学、3D 结构信息和机器人本体感受状态进行建模,并进一步在时间维度上扩展这些表征,以实现时间一致的隐式推理轨迹。此外,LaST 采用了通过混合 Transformer 设计实现的双系统架构,其中推理专家进行低频潜在推理,行动专家基于面向机器人的潜在表征生成高频动作。为了促进协调,LaST 以异构操作频率进行训练,从而在部署期间实现自适应切换。在涵盖桌面、移动和灵巧手操作的 10 项真实世界任务中,LaST 相比先前的 SOTA VLA 方法,平均成功率分别提高了 13%、14% 和 14%。
引用
@article{arxiv.2601.05248,
title = {LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model},
author = {Zhuoyang Liu and Jiaming Liu and Hao Chen and Jiale Yu and Ziyu Guo and Chengkai Hou and Chenyang Gu and Xiangju Mi and Renrui Zhang and Kun Wu and Zhengping Che and Jian Tang and Pheng-Ann Heng and Shanghang Zhang},
journal= {arXiv preprint arXiv:2601.05248},
year = {2026}
}
备注
Project page: https://vla-last0.github.io/