中文

RoboScape-R:基于 RL 的统一奖励-观察世界模型用于通用机器人训练

机器人学 2025-12-04 v1 计算机视觉与模式识别

摘要

实现可泛化的具身策略仍是关键挑战。传统的策略学习范式,包括仿射学习 (IL) 和强化学习 (RL),在跨场景泛化方面存在困难。虽然 IL 策略常常过拟合到特定的专家轨迹,但 RL 因缺乏统一且通用的奖励信号而难以实现有效的多场景泛化。我们认为,世界模型在作为通用环境代理方面具有独特优势。然而,当前的世界模型主要关注其预测观察的能力,仍依赖于任务特定的、手工设计的奖励函数,无法提供真正通用的训练环境。为此,我们提出了 RoboScape-R 框架,利用世界模型作为具身环境在 RL 框架中的通用代理。我们引入一种新型基于世界模型的通用奖励机制,生成源自模型内在对真实世界状态转移动态理解的“内在奖励”。广泛的实验表明,RoboScape-R 有效地解决了传统 RL 方法的局限性,通过提供高效且通用的训练环境,显著提升了具身策略的泛化能力。我们的方法为利用世界模型作为在线训练策略提供了关键洞见,并在域外场景下实现了约 37.5% 的性能提升。

关键词

引用

@article{arxiv.2512.03556,
  title  = {RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL},
  author = {Yinzhou Tang and Yu Shang and Yinuo Chen and Bingwen Wei and Xin Zhang and Shu'ang Yu and Liangzhi Shi and Chao Yu and Chen Gao and Wei Wu and Yong Li},
  journal= {arXiv preprint arXiv:2512.03556},
  year   = {2025}
}