中文

BagelVLA:通过交错视觉语言动作生成提升长期操作

机器人学 2026-02-12 v2

摘要

为通用操作赋予推理任务、预见物理结果并生成精确动作的能力是必不可少的。虽然近期的视觉语言动作(VLA)模型利用预训练基础模型,但通常仅聚焦于 linguistic planning 或 visual forecasting,二者往往孤立存在。这导致在复杂长期操作任务中表现不佳。为弥合这一差距,我们提出 BagelVLA,一个统一的模型,将 linguistic planning、visual forecasting 和 action generation 集成到单个框架中。BagelVLA 基于预训练的统一理解和生成模型初始化,训练用于在动作执行循环中交错文本推理和视觉预测。为高效耦合这些模态,我们引入残差流引导(RFG),从当前观察初始化并利用单步去噪提取预测视觉特征,将其引导动作生成,实现最小延迟。大量实验表明,BagelVLA 在多个模拟和真实世界基准测试中显著优于现有基线,尤其在需要多阶段推理的任务中表现突出。

关键词

引用

@article{arxiv.2602.09849,
  title  = {BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation},
  author = {Yucheng Hu and Jianke Zhang and Yuanfei Luo and Yanjiang Guo and Xiaoyu Chen and Xinshu Sun and Kun Feng and Qingzhou Lu and Sheng Chen and Yangang Zhang and Wei Li and Jianyu Chen},
  journal= {arXiv preprint arXiv:2602.09849},
  year   = {2026}
}