具有子任务依赖关系自主推断的元强化学习
机器学习
2020-04-15 v2 人工智能
机器学习
摘要
我们提出并解决了一个新颖的小样本强化学习(RL)问题,其中任务由一个子任务图刻画,该图描述了一组子任务及其依赖关系,且这些对智能体未知。智能体需要在适应阶段通过少量回合快速适应任务,以在测试阶段最大化回报。我们不直接学习元策略,而是开发了带有子任务图推断(MSGI)的元学习器,其通过与环境交互推断任务的潜参数,并在给定潜参数的情况下最大化回报。为促进学习,我们采用受上置信界(UCB)启发的内在奖励以鼓励高效探索。我们在两个网格世界域与 StarCraft II 环境中的实验结果表明,所提方法能够准确推断潜任务参数,并且比现有的元强化学习与分层强化学习方法适应得更高效。
引用
@article{arxiv.2001.00248,
title = {Meta Reinforcement Learning with Autonomous Inference of Subtask Dependencies},
author = {Sungryull Sohn and Hyunjae Woo and Jongwook Choi and Honglak Lee},
journal= {arXiv preprint arXiv:2001.00248},
year = {2020}
}
备注
Published in ICLR 2020