中文

点燃视觉语言模型迈向具身空间

机器人学 2025-09-16 v1

摘要

尽管基础模型在语言和视觉方面取得了显著进展,但现有的视觉语言模型(VLMs)在空间和具身理解方面仍然有限。将 VLMs 迁移到具身领域揭示了模态、预训练分布和训练目标之间的根本不匹配,使得动作理解和生成成为通向 AGI 道路上的核心瓶颈。我们引入了 WALL-OSS,一个端到端的具身基础模型,利用大规模多模态预训练来实现(1)具身感知的视觉语言理解,(2)强大的语言-动作关联,以及(3)鲁棒的操控能力。我们的方法采用紧密耦合的架构和多策略训练课程,实现了统一跨层级思维链——在单一可微分框架中无缝统一指令推理、子目标分解和细粒度动作合成。我们的结果表明,WALL-OSS 在复杂长时序操控任务上取得了高成功率,展示了强大的指令遵循能力、复杂理解和推理能力,并超越了强大的基线,从而为从 VLMs 到具身基础模型提供了一条可靠且可扩展的路径。

关键词

引用

@article{arxiv.2509.11766,
  title  = {Igniting VLMs toward the Embodied Space},
  author = {Andy Zhai and Brae Liu and Bruno Fang and Chalse Cai and Ellie Ma and Ethan Yin and Hao Wang and Hugo Zhou and James Wang and Lights Shi and Lucy Liang and Make Wang and Qian Wang and Roy Gan and Ryan Yu and Shalfun Li and Starrick Liu and Sylas Chen and Vincent Chen and Zach Xu},
  journal= {arXiv preprint arXiv:2509.11766},
  year   = {2025}
}