中文

链式世界:隐空间运动中的世界模型思考

计算机视觉与模式识别 2026-03-04 v1 人工智能 机器人学

摘要

视觉-语言-动作 (VLA) 模型是具身智能的有前景的路径,但常常忽视了视觉动态背后的预测性和时序因果结构。世界模型 VLA 通过预测未来帧来解决此问题,但会浪费容量对冗余背景进行重建。隐空间动作 VLA 对帧间转换进行紧凑编码,但缺乏时序连续的动态建模和世界知识。为克服这些限制,我们引入 CoWVLA(链式世界 VLA),一种新的“链式世界”范式,将世界模型时序推理与解耦的隐空间运动表示统一起来。首先,预训练的视频 VAE 作为隐空间运动提取器,显式地将视频片段分解为结构和运动隐变量。随后,在预训练期间,VLA 从指令和初始帧推断连续的隐空间运动链并预测片段的终端帧。最后,在共微调期间,这种隐动态通过在统一的自回归解码器中联合建模稀疏关键帧和动作序列,将其与离散动作预测对齐。此设计保留了世界模型在时序推理和世界知识方面的优势,同时保持隐空间动作的紧凑性和可解释性,实现了高效的视觉运动学习。大量实验在机器人仿真基准中表明,CoWVLA 在现有世界模型和隐空间动作方法中取得了优异性能,实现了适度的计算效率,凸显其作为更有效 VLA 预训练范式的潜力。项目网站可在 https://fx-hit.github.io/cowvla-io 查找。

关键词

引用

@article{arxiv.2603.03195,
  title  = {Chain of World: World Model Thinking in Latent Motion},
  author = {Fuxiang Yang and Donglin Di and Lulu Tang and Xuancheng Zhang and Lei Fan and Hao Li and Chen Wei and Tonghua Su and Baorui Ma},
  journal= {arXiv preprint arXiv:2603.03195},
  year   = {2026}
}

备注

Accepted by CVPR2026. Project page: https://fx-hit.github.io/cowvla-io/