中文

从分割演示中学习子任务感知的视觉奖励

机器人学 2025-03-03 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

强化学习(RL)智能体已在各种机器人任务中展现了其潜力。然而,它们仍然严重依赖人工设计的奖励函数,需要大量的试错并获取目标行为信息,而这些在现实世界环境中通常是无法获得的。本文介绍了 REDS:基于分割的演示奖励学习,这是一种利用无动作视频且仅需最少监督的新颖奖励学习框架。具体而言,REDS 采用从不同来源分割成子任务的视频演示,并将这些片段视为真实奖励。我们训练了一个以视频片段及其对应子任务为条件的密集奖励函数,通过最小化等策略不变比较距离来确保与真实奖励信号对齐。此外,我们采用对比学习目标将视频表示与子任务对齐,确保在线交互期间的精确子任务推断。我们的实验表明,REDS 在 Meta-World 中的复杂机器人操作任务和更具挑战性的现实世界任务(如 FurnitureBench 中的家具组装)中,以最少的人工干预显著优于基线方法。此外,REDS 促进了对未见任务和机器人具身的泛化,突显了其在多样化环境中可扩展部署的潜力。

关键词

引用

@article{arxiv.2502.20630,
  title  = {Subtask-Aware Visual Reward Learning from Segmented Demonstrations},
  author = {Changyeon Kim and Minho Heo and Doohyun Lee and Jinwoo Shin and Honglak Lee and Joseph J. Lim and Kimin Lee},
  journal= {arXiv preprint arXiv:2502.20630},
  year   = {2025}
}

备注

Project webpage: https://changyeon.site/reds/