基于多任务深度强化学习的零样本任务泛化
人工智能
2017-11-08 v2 机器学习
摘要
作为在强化学习 (RL) 中发展零样本任务泛化能力的一步,我们引入了一个新的 RL 问题:智能体应在学习解决子任务的有用技能后,学会执行指令序列。在此问题中,我们考虑两种泛化:对先前未见指令的泛化,以及对更长指令序列的泛化。针对未见指令的泛化,我们提出了一个新的目标,该目标通过类比鼓励学习相似子任务之间的对应关系。针对序列指令的泛化,我们提出了一种分层架构,其中元控制器学习使用已获得的技能来执行指令。为了处理延迟奖励,我们在元控制器中提出了一种新的神经架构,该架构学习何时更新子任务,从而提高学习效率。在随机 3D 环境中的实验结果表明,所提出的想法对于泛化到更长指令以及未见指令至关重要。
引用
@article{arxiv.1706.05064,
title = {Zero-Shot Task Generalization with Multi-Task Deep Reinforcement Learning},
author = {Junhyuk Oh and Satinder Singh and Honglak Lee and Pushmeet Kohli},
journal= {arXiv preprint arXiv:1706.05064},
year = {2017}
}
备注
ICML 2017