Robot-R1:用于增强机器人具身推理的强化学习
机器人学
2026-01-19 v3 人工智能
摘要
大型视觉语言模型(LVLM)近期在推进机器人技术方面展现出巨大潜力,其将具身推理与机器人控制相结合。一种常见方法是使用监督微调(SFT)在与机器人控制相关的具身推理任务上进行训练。然而,SFT数据集通常是启发式构建的,并未针对改进机器人控制进行显式优化。此外,SFT常导致灾难性遗忘和泛化性能下降等问题。为解决这些局限性,我们提出了Robot-R1,一种利用强化学习专门增强机器人控制具身推理的新框架。Robot-R1学习在当前场景图像和源自专家演示的环境元数据条件下,预测完成任务所需的下一个关键点状态。受DeepSeek-R1学习方法启发,Robot-R1对基于推理的响应进行采样,并对那些能带来更准确预测的响应进行强化。为严格评估Robot-R1,我们还引入了一个需要任务具备多样化具身推理能力的新基准。我们的实验表明,使用Robot-R1训练的模型在具身推理任务上优于SFT方法。尽管仅有7B参数,Robot-R1在低层动作控制相关的推理任务上(如空间和运动推理)甚至超越了GPT-4o。
引用
@article{arxiv.2506.00070,
title = {Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics},
author = {Dongyoung Kim and Sumin Park and Huiwon Jang and Jinwoo Shin and Jaehyung Kim and Younggyo Seo},
journal= {arXiv preprint arXiv:2506.00070},
year = {2026}
}
备注
NeurIPS 2025