面向具有子任务依赖的零样本泛化的分层强化学习
机器学习
2019-05-28 v4 人工智能
机器学习
摘要
我们引入了一个新的强化学习(RL)问题,其中要求智能体泛化到一个先前未见过、由子任务图刻画的环境中,该图描述了一组子任务及其依赖关系。与现有的显式描述智能体应在高层做什么的分层多任务 RL 方法不同,我们的问题仅描述子任务的属性及其之间的关系,这要求智能体执行复杂的推理以找到最优执行的子任务。为解决这个问题,我们提出了一种神经子任务图求解器(NSGS),它使用递归神经网络嵌入对子任务图进行编码。为克服训练困难,我们提出了一种新颖的基于梯度的非参数策略——图奖励传播,来预训练我们的 NSGS 智能体,并通过 actor-critic 方法进一步微调。在两个 2D 视觉域上的实验结果表明,我们的智能体能够执行复杂推理以找到执行子任务图的近最优方式,并能很好地泛化到未见的子任务图。此外,我们将我们的智能体与蒙特卡洛树搜索(MCTS)方法进行比较,表明我们的方法比 MCTS 高效得多,且 NSGS 的性能可通过与 MCTS 结合而进一步提升。
引用
@article{arxiv.1807.07665,
title = {Hierarchical Reinforcement Learning for Zero-shot Generalization with Subtask Dependencies},
author = {Sungryull Sohn and Junhyuk Oh and Honglak Lee},
journal= {arXiv preprint arXiv:1807.07665},
year = {2019}
}
备注
In NeurIPS 2018