中文

DrS:学习多阶段任务的可复用稠密奖励

机器学习 2024-04-26 v1 人工智能 机器人学

摘要

许多强化学习技术的成功严重依赖人工设计的稠密奖励,这通常需要大量的领域专业知识和反复试错。在我们的工作中,我们提出了 DrS(Dense reward learning from Stages,基于阶段的稠密奖励学习),一种以数据驱动方式学习多阶段任务可复用稠密奖励的新方法。通过利用任务的阶段结构,DrS 从稀疏奖励和(如果提供)演示中学习高质量的稠密奖励。学习到的奖励可以在未见任务中被复用,从而减少奖励工程的人力投入。在三个具有 1000 多个任务变体的物理机器人操作任务族上的大量实验表明,我们学习到的奖励可以在未见任务中复用,从而提高了强化学习算法的性能和样本效率。在某些任务上,学习到的奖励甚至取得了与人工设计奖励相当的性能。更多详情请参见我们的项目页面 (https://sites.google.com/view/iclr24drs)。

关键词

引用

@article{arxiv.2404.16779,
  title  = {DrS: Learning Reusable Dense Rewards for Multi-Stage Tasks},
  author = {Tongzhou Mu and Minghua Liu and Hao Su},
  journal= {arXiv preprint arXiv:2404.16779},
  year   = {2024}
}

备注

ICLR 2024. Explore videos, data, code, and more at https://sites.google.com/view/iclr24drs