中文

机器人控制的因果世界建模

计算机视觉与模式识别 2026-03-24 v2 机器人学

摘要

本工作表明,视频世界建模与视觉语言预训练相继确立了机器人学习的全新且独立的基础。直观而言,视频世界模型通过理解动作与视觉动态之间的因果关系,提供了对近期未来进行想象的能力。鼓舞于此,我们引入LingBot-VA,这是一个自回归扩散框架,同时学习帧预测和策略执行。我们的模型包含三个精心设计的要素:(1)一个共享潜在空间,将视觉和动作标记整合起来,由混合式转换器(MoT)架构驱动;(2)一个闭环滚动机制,允许持续获取环境反馈并使用真实观测;(3)一个异步推理管道,平行化动作预测和电机执行,以支持高效控制。我们在模拟基准和真实场景中评估了我们的模型,在长期操作、事后训练的数据效率以及对新配置的强大可泛性方面均显示出巨大的潜力。我们将代码和模型公开,以促进社区发展。

关键词

引用

@article{arxiv.2601.21998,
  title  = {Causal World Modeling for Robot Control},
  author = {Lin Li and Qihang Zhang and Yiming Luo and Shuai Yang and Ruilin Wang and Fei Han and Mingrui Yu and Zelin Gao and Nan Xue and Xing Zhu and Yujun Shen and Yinghao Xu},
  journal= {arXiv preprint arXiv:2601.21998},
  year   = {2026}
}

备注

Project page: https://technology.robbyant.com/lingbot-va Code: https://github.com/robbyant/lingbot-va