TriVLA:基于三体系统的统一视觉-语言-动作模型及其用于通用机器人控制的情景世界建模
机器人学
2025-10-14 v3
摘要
近期视觉-语言模型(VLM)的进展使机器人能够遵循开放指令并展现出色的常识推理能力。然而,当前的视觉-语言-动作(VLA)框架主要依赖静态表征和有限的时间上下文,限制了智能体仅能进行短视角、反应式行为,阻碍了在动态具身环境中实现稳健的泛化。灵感来自认知神经科学中关于情景记忆的理论,我们提出,可能是首个在VLA中正式化的情景世界模型,使具身机器人能够累积、调用和预测序列化经验。作为这一概念的实例,我们的统一TriVLA通过三体系结构实现情景世界模型:集成来自预训练VLM的多模态 grounding(System 2)和来自视频扩散模型的时序丰富动力学感知(System 3)。这使智能体能够累积和调用序列化经验,解释当前情境,并预测未来环境的演化。基于跨越过去与预期未来的情景表征,下游策略(System 1)通过流匹配和跨模态注意力机制生成连贯、情境感知的动作序列。实验结果表明,TriVLA在约36 Hz的频率下高效运行,并在标准基准和具挑战性的真实世界操控任务上 consistently 优于基线模型。它展现出强大的长期计划和开放意图理解能力,凸显了受情景世界模型启发的推理在实现稳健、通用机器人智能方面的优势。项目页面:https://zhenyangliu.github.io/TriVLA/。
引用
@article{arxiv.2507.01424,
title = {TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control},
author = {Zhenyang Liu and Yongchong Gu and Sixiao Zheng and Yanwei Fu and Xiangyang Xue and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2507.01424},
year = {2025}
}