中文

通过元学习子目标发现选项

机器学习 2021-02-16 v1 人工智能

摘要

以选项形式出现的时间抽象已被证明有助于强化学习(RL)智能体更快学习。然而,尽管已有相关研究,通过与环境交互来发现选项的问题仍然是一项挑战。本文中,我们引入一种新颖的元梯度方法,用于在多任务 RL 环境中发现有用的选项。我们的方法基于 RL 智能体的管理者-工作者分解,其中管理者通过学习关于一组任务无关的已发现选项和基本动作的任务依赖策略来最大化环境奖励。定义每个选项子目标的选项奖励和终止函数被参数化为神经网络,并通过元梯度训练以最大化其有用性。在 gridworld 和 DeepMind Lab 任务上的实证分析表明:(1) 我们的方法能在多任务 RL 域中发现有意义且多样的时间扩展选项,(2) 已发现的选项在智能体学习解决训练任务时被频繁使用,以及 (3) 已发现的选项能帮助随机初始化的管理者在全新任务中更快学习。

关键词

引用

@article{arxiv.2102.06741,
  title  = {Discovery of Options via Meta-Learned Subgoals},
  author = {Vivek Veeriah and Tom Zahavy and Matteo Hessel and Zhongwen Xu and Junhyuk Oh and Iurii Kemaev and Hado van Hasselt and David Silver and Satinder Singh},
  journal= {arXiv preprint arXiv:2102.06741},
  year   = {2021}
}