中文

SOP:面向视觉-语言-动作模型的可扩展在线后训练系统

机器人学 2026-01-07 v1

摘要

视觉-语言-动作(VLA)模型通过大规模预训练实现强大的泛化能力,但实际部署需要在保持广泛通用性的同时达到专家水平的任务熟练度。现有的VLA模型后训练方法通常是离线的、单机器人或任务特定的,这限制了有效的on-policy适应和可扩展的真实世界学习。我们引入一个可扩展的在线后训练(SOP)系统,使其能够在物理世界中直接对通用VLA模型进行在线、分布式、多任务后训练。SOP通过一种闭环体系结构将执行与学习紧密耦合:一组机器人持续流式传输on-policy经验和人类干预信号至中央云学习器,异步接收更新后的策略。此设计支持快速on-policy纠正,通过并行部署扩展经验收集,并在适应期间保持通用性。SOP对后训练算法的选择是中性的;我们以交互式模仿学习(HG-DAgger)和强化学习(RECAP)为例进行实例化。在包括折叠布料、盒子装配和杂货补货等多个真实世界操作任务上,我们表明SOP在保持单一共享策略跨任务的同时,显著提升了大型预训练VLA模型的性能。有效的后训练可在数小时的真实世界交互内实现,性能随机器人队伍规模呈近线性比例增长。这些结果表明,将在线学习与规模化部署紧密耦合是实现物理世界中通用机器人策略高效、可靠且可扩展后训练的关键。

关键词

引用

@article{arxiv.2601.03044,
  title  = {SOP: A Scalable Online Post-Training System for Vision-Language-Action Models},
  author = {Mingjie Pan and Siyuan Feng and Qinglin Zhang and Xinchen Li and Jianheng Song and Chendi Qu and Yi Wang and Chuankang Li and Ziyu Xiong and Zhi Chen and Yi Liu and Jianlan Luo},
  journal= {arXiv preprint arXiv:2601.03044},
  year   = {2026}
}