前向-后向强化学习
机器学习
2018-03-29 v1 人工智能
机器学习
摘要
强化学习问题的目标通常通过手工指定的奖励来定义。为了设计此类问题,学习算法的开发者必须 inherently 知晓任务目标是什么,然而我们常常要求智能体在除这些稀疏奖励外无任何监督的情况下自行发现它们。尽管强化学习的许多能力源于智能体可在极少引导下学习的概念,这一要求极大地加重了训练过程的负担。如果我们放宽这一限制,赋予智能体对奖励函数尤其是目标的认知,便可利用逆向归纳来加速训练。为此,我们提出训练一个模型,学习从已知目标状态出发采取想象的逆向步骤。我们的方法并非仅训练智能体在时间向前推进时确定如何到达目标,而是向后回溯以联合预测我们是如何到达该目标的。我们在 Gridworld 与汉诺塔中评估了我们的工作,并经验性地证明其与标准 DDQN 相比具有更优性能。
引用
@article{arxiv.1803.10227,
title = {Forward-Backward Reinforcement Learning},
author = {Ashley D. Edwards and Laura Downs and James C. Davidson},
journal= {arXiv preprint arXiv:1803.10227},
year = {2018}
}