中文

ReWiND:语言引导的奖励教导机器人策略无需新演示

机器人学 2025-09-23 v2

摘要

我们提出了 ReWiND,一个仅从语言指令学习机器人操作任务的框架,无需每个任务的演示。标准强化学习(RL)和模仿学习方法需要通过人工设计的奖励函数或演示对每个新任务进行专家监督。相比之下,ReWiND 从小型演示数据集开始学习:(1)一个数据高效、语言条件化的奖励函数,用于对数据集标记奖励,以及(2)使用这些奖励进行离线 RL 的语言条件化策略。对于未见的任务变体,ReWiND 通过所学奖励函数微调预训练策略,只需最小化在线交互。我们表明 ReWiND 的奖励模型对未见任务具有有效的泛化能力,相对于基线在奖励泛化和策略对齐指标上提高最高可达 2.4 倍。最后,我们演示了 ReWiND 使样本效率适应新任务的能力,在仿真中击败基线 2 倍,在实际中改进预训练双手策略 5 倍,为可扩展的实际机器人学习之路迈出了一步。

关键词

引用

@article{arxiv.2505.10911,
  title  = {ReWiND: Language-Guided Rewards Teach Robot Policies without New Demonstrations},
  author = {Jiahui Zhang and Yusen Luo and Abrar Anwar and Sumedh Anand Sontakke and Joseph J Lim and Jesse Thomason and Erdem Biyik and Jesse Zhang},
  journal= {arXiv preprint arXiv:2505.10911},
  year   = {2025}
}

备注

CoRL 2025 Oral