从分割演示中学习子任务感知的视觉奖励
机器人学
2025-03-03 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
强化学习(RL)智能体已在各种机器人任务中展现了其潜力。然而,它们仍然严重依赖人工设计的奖励函数,需要大量的试错并获取目标行为信息,而这些在现实世界环境中通常是无法获得的。本文介绍了 REDS:基于分割的演示奖励学习,这是一种利用无动作视频且仅需最少监督的新颖奖励学习框架。具体而言,REDS 采用从不同来源分割成子任务的视频演示,并将这些片段视为真实奖励。我们训练了一个以视频片段及其对应子任务为条件的密集奖励函数,通过最小化等策略不变比较距离来确保与真实奖励信号对齐。此外,我们采用对比学习目标将视频表示与子任务对齐,确保在线交互期间的精确子任务推断。我们的实验表明,REDS 在 Meta-World 中的复杂机器人操作任务和更具挑战性的现实世界任务(如 FurnitureBench 中的家具组装)中,以最少的人工干预显著优于基线方法。此外,REDS 促进了对未见任务和机器人具身的泛化,突显了其在多样化环境中可扩展部署的潜力。
引用
@article{arxiv.2502.20630,
title = {Subtask-Aware Visual Reward Learning from Segmented Demonstrations},
author = {Changyeon Kim and Minho Heo and Doohyun Lee and Jinwoo Shin and Honglak Lee and Joseph J. Lim and Kimin Lee},
journal= {arXiv preprint arXiv:2502.20630},
year = {2025}
}
备注
Project webpage: https://changyeon.site/reds/