面向连续深度强化学习的课程目标掩蔽
机器学习
2019-02-14 v2 机器学习
摘要
深度强化学习近来聚焦于策略或价值函数与目标无关的问题。有证据表明目标的采样对学习性能有强烈影响,但缺乏专注于优化目标采样过程的通用机制。本工作中,我们提出一种简单且通用的目标掩蔽方法,该方法还能估计目标的难度水平,从而实现深度RL的课程学习方案。我们的结果表明,聚焦于中等难度水平的目标适用于深度确定性策略梯度(DDPG)方法,而“志存高远、退而求其次”策略(即困难目标比简单目标被采样频繁得多)在DDPG与后见经验回放(HER)结合的情况下带来最佳学习性能。我们证明该方法在不同机器人物体操纵问题上显著优于标准目标采样。
引用
@article{arxiv.1809.06146,
title = {Curriculum goal masking for continuous deep reinforcement learning},
author = {Manfred Eppe and Sven Magg and Stefan Wermter},
journal= {arXiv preprint arXiv:1809.06146},
year = {2019}
}