中文

OmniVLA-RL:具备空间感知能力的视觉-语言-动作模型

机器人学 2026-04-27 v2

摘要

视觉-语言-动作 (VLA) 模型代表了具身 AI 的范式转变,但现有框架常常在空间感知不精确、多模态融合次优以及强化学习不稳定方面存在挑战。为弥合这些差距,我们提出了 OmniVLA-RL,一种新型架构,利用 Mix-of-Transformers (MoT) 设计, synergistically 集成推理、空间和动作专家。进一步引入 Flow-GSPO,将流匹配重新表述为随机微分方程 (SDE) 过程,并与群分段策略优化 (GSPO) 集成,以增强动作精度和训练鲁棒性。在 LIBERO 和 LIBERO-Plus 基准上的大规模评估表明,OmniVLA-RL 在整体性能上取得良好成绩,并超越主流现有方法,有效克服了当前 VLA 模型的根本局限。

关键词

引用

@article{arxiv.2604.17706,
  title  = {OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL},
  author = {Haoxiang Jie and Yaoyuan Yan and Xiangyu Wei and Kailin Wang and Hongjie Yan and Zhiyou Heng and Daocheng Chen},
  journal= {arXiv preprint arXiv:2604.17706},
  year   = {2026}
}