PROGRESSOR:一种带有自监督在线细化的感知引导奖励估计器
机器人学
2024-11-28 v1 人工智能
摘要
我们提出PROGRESSOR,一个新型框架,能够从视频中学习任务无关的奖励函数,使其能够通过目标条件强化学习(RL)进行策略训练,无需手动监督。该奖励基于对当前、初始和目标观察值函数分布估计的任务进度,采用自监督方式进行学习。关键在于,PROGRESSOR在在线RL训练期间通过对抗方式细化奖励,对推测的离分布观察值进行反向推送,以缓解非专家观察中固有的分布迁移问题。利用这种进度预测作为密集奖励,并结合对抗推送,我们展示了PROGRESSOR使机器人能够在无外部监督下学习复杂行为。 在EPIC-KITCHENS上的大规模体agnostic人类视频预训练后,PROGRESSOR无需针对特定任务的数据进行微调,即可在噪声演示的真实机器人离线RL中实现泛化,优于提供稠密视觉奖励的当代方法。我们的发现凸显了PROGRESSOR在直接动作标签和任务特定奖励难以获得的可扩展机器人应用中的潜力。
引用
@article{arxiv.2411.17764,
title = {PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement},
author = {Tewodros Ayalew and Xiao Zhang and Kevin Yuanbo Wu and Tianchong Jiang and Michael Maire and Matthew R. Walter},
journal= {arXiv preprint arXiv:2411.17764},
year = {2024}
}
备注
15 pages,13 figures