SOLE-R1:将视频-语言推理作为机器人强化学习的唯一奖励信号
机器人学
2026-05-27 v2 计算与语言
计算机视觉与模式识别
摘要
视觉-语言模型 (VLM) 在 diverse 任务中展现出惊人的能力,推动了利用这些模型来监督机器人学习的努力。然而,当这些模型用作强化学习 (RL) 中的评估器时,今天最强的模型常常在部分可观测性和分布迁移下失败,使策略能够利用感知错误而非解决任务。我们引入 SOLE-R1 (自我观察学习者),一个专为作为在线 RL 的唯一奖励信号而设计的视频-语言推理模型。仅凭原始视频观察和自然语言目标,SOLE-R1 执行每一步时空链式思考 (CoT) 推理,生成可用于直接作为奖励的 task progress 密集估计。为训练 SOLE-R1,我们开发了一个大规模视频轨迹和推理合成管道,生成与连续 progress 监督对齐的时序链式思考痕迹。该数据结合了基础的空间和多帧时序推理,用于训练采用混合框架(将监督微调与来自可验证奖励的 RL 结合)的模型。在四个不同的仿真环境和一个实际机器人设置中,SOLE-R1 实现了从随机初始化的零样本在线 RL:机器人能够在没有 ground-truth 奖励、成功指示、演示或任务特定调优的情况下学习以前未见过的操纵任务。SOLE-R1 在 24 个未见任务上成功,并显著优于强大的视觉-语言奖励器,包括 Robometer、RoboReward、ReWiND、GPT-5 和 Gemini-3-Pro,同时在奖励黑客方面表现出明显更大的鲁棒性。我们在匿名页面发布所有模型、数据、代码和演示:https://philip-mit.github.io/sole-r1/。
引用
@article{arxiv.2603.28730,
title = {SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning},
author = {Philip Schroeder and Thomas Weng and Karl Schmeckpeper and Eric Rosen and Stephen Hart and Ondrej Biza},
journal= {arXiv preprint arXiv:2603.28730},
year = {2026}
}