发现、学习、强化:基于多样化 RL 生成轨迹的视觉语言-动作预训练扩展
机器人学
2025-11-26 v1 人工智能
摘要
视觉语言-动作(VLA)模型的预训练需要大量多样化、高质量的操纵轨迹。大多数当前数据通过人类遥操作获取,成本高昂且难以扩展。强化学习(RL)方法通过自主探索学习有用技能,因而是生成数据的一个可行方法。然而,标准 RL 训练会坍缩为狭窄的执行模式,限制了其用于大规模预训练的实用性。我们提出发现、学习和强化(Discover, Learn and Reinforce, DLR),这是一个信息论驱动的模式发现框架,用于生成用于 VLA 预训练的多个 distinct、高成功率的行为模式。实证结果表明,DLR 在 LIBERO 上生成的轨迹语料库显著更加多样化。具体而言,它为同一任务学习多个 distinct、高成功率的策略,而标准 RL 只发现一种,从而涵盖了状态-动作空间的更广广阔区域。当适用于未见的下游任务套件时,基于我们多样化的 RL 数据预训练的 VLA 模型在与基于等量标准 RL 数据集训练的模型相当的下游任务上实现了优异性能。此外,DLR 表现出正的规模行为,而单一模式 RL 则缺乏这种行为。这些结果将多模式 RL 定位为具身基础模型的实用、可扩展的数据引擎。
引用
@article{arxiv.2511.19528,
title = {Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories},
author = {Rushuai Yang and Zhiyuan Feng and Tianxiang Zhang and Kaixin Wang and Chuheng Zhang and Li Zhao and Xiu Su and Yi Chen and Jiang Bian},
journal= {arXiv preprint arXiv:2511.19528},
year = {2025}
}