对后见学习的改进
机器学习
2018-11-06 v2 机器学习
摘要
稀疏奖励问题是强化学习中最重大的挑战之一。目标导向任务正是这样一种稀疏奖励问题,仅当达到目标时才接收到奖励信号。训练智能体执行目标导向任务的一种有前景的方法是使用后见学习(Hindsight Learning)方法。在这些方法中,即便智能体未能达到期望目标,它也会学习去达到其实际达成的目标。通过在多条轨迹上如此操作并泛化从已达成目标中学到的策略,智能体学习到一种以目标为条件的策略以抵达任意目标。其中一种方法是后见经验回放(Hindsight Experience Replay),它使用离策略强化学习算法来学习以目标为条件的策略。在该方法中,对过去转移的回放以均匀随机方式进行。另一种方法是使用策略梯度的后见版本来直接学习策略。在本工作中,我们讨论回放过去转移的不同方式以改进后见经验回放中的学习,尤其关注优先化变体。此外,我们将后见策略梯度方法实现于机器人任务中。
引用
@article{arxiv.1809.06719,
title = {Improvements on Hindsight Learning},
author = {Ameet Deshpande and Srikanth Sarma and Ashutosh Jha and Balaraman Ravindran},
journal= {arXiv preprint arXiv:1809.06719},
year = {2018}
}