HIRL:面向带延迟奖励的长视野任务的分层逆强化学习
机器人学
2016-04-25 v1
摘要
强化学习(RL)在具有延迟奖励的问题中表现不佳,一种方法是将任务划分为具有增量奖励的子任务。我们提出了一个称为分层逆强化学习(HIRL)的框架,这是一种从演示中学习子任务结构的模型。HIRL 基于跨演示一致的转移将任务分解为子任务。这些转移被定义为相对于核函数的局部线性的变化。随后,HIRL 利用推断出的结构学习子任务局部的奖励函数,同时处理任何全局依赖(如顺序性)。我们在多个标准 RL 基准上评估了 HIRL:带噪声动态的并行泊车、双连杆摆、二维噪声运动规划以及一个弹球环境。在并行泊车任务中,我们发现使用 HIRL 构建的奖励比使用最大熵逆 RL(MaxEnt IRL)构建的奖励少用 32% 的时间步即可收敛到成功率为 80% 的策略;在部分状态观测下,用 IRL 学习的策略无法达到该精度,而 HIRL 仍能收敛。我们进一步发现,HIRL 学习的奖励对环境噪声具有鲁棒性,能够容忍环境障碍位姿中 1 个标准差的随机扰动,同时保持大致相同的收敛速率。我们发现 HIRL 奖励的收敛速度可比 IRL 构建的奖励快至多 6 倍。
引用
@article{arxiv.1604.06508,
title = {HIRL: Hierarchical Inverse Reinforcement Learning for Long-Horizon Tasks with Delayed Rewards},
author = {Sanjay Krishnan and Animesh Garg and Richard Liaw and Lauren Miller and Florian T. Pokorny and Ken Goldberg},
journal= {arXiv preprint arXiv:1604.06508},
year = {2016}
}
备注
12 pages