通过探索先验行为来学习任务
机器人学
2023-07-11 v1 人工智能
机器学习
摘要
演示数据被广泛用于深度强化学习(DRL)中以辅助解决稀疏奖励任务。然而,真实场景中的任务其初始条件往往与演示数据不同,这将需要额外的先验行为。例如,假设我们给定了“从打开的抽屉中取出物体”任务的演示,但在训练中抽屉是关闭的。若未习得打开抽屉的先验行为,机器人不太可能解决该任务。为此,本文提出一种内在奖励驱动的基于样例的控制(IRDEC)。我们的方法能使智能体具备探索并习得所需先验行为的能力,随后衔接演示中任务特定的行为,从而在无需额外先验行为演示的情况下解决稀疏奖励任务。我们的方法在三个导航任务和一个稀疏奖励机器人操作任务上的性能优于其他基线。代码见 https://github.com/Ricky-Zhu/IRDEC。
引用
@article{arxiv.2307.02889,
title = {Learning to Solve Tasks with Exploring Prior Behaviours},
author = {Ruiqi Zhu and Siyuan Li and Tianhong Dai and Chongjie Zhang and Oya Celiktutan},
journal= {arXiv preprint arXiv:2307.02889},
year = {2023}
}