通过事后目标生成进行探索
机器学习
2019-12-19 v3 机器学习
摘要
目标导向的强化学习最近已成为机器人操作任务的一个实用框架,其中智能体需要达到由状态空间上的某个函数定义的特定目标。然而,这种奖励定义的稀疏性使得传统的强化学习算法效率极低。近期的一项进展——事后经验回放(HER),极大地提高了此类问题的样本效率和实际适用性。它通过一种简单的启发式方法构造虚构目标来利用先前的回放,像一个隐式课程一样缓解了稀疏奖励信号的挑战。在本文中,我们引入了事后目标生成(HGG),这是一种新颖的算法框架,能够生成有价值的事后目标,这些目标既易于智能体在短期内实现,又具有引导智能体长期达到实际目标的潜力。我们在多个机器人操作任务上广泛评估了我们的目标生成算法,并证明了在样本效率方面相比原始 HER 有显著提升。
引用
@article{arxiv.1906.04279,
title = {Exploration via Hindsight Goal Generation},
author = {Zhizhou Ren and Kefan Dong and Yuan Zhou and Qiang Liu and Jian Peng},
journal= {arXiv preprint arXiv:1906.04279},
year = {2019}
}
备注
Thirty-third Conference on Neural Information Processing Systems (NeurIPS 2019)