中文

学习任务的新颖策略

机器学习 2020-02-03 v2 机器学习

摘要

本文提出一种强化学习算法,能为给定任务奖励函数的任务找到多种策略(新颖策略)。我们的方法通过创建第二个奖励函数来实现这一点,该函数识别先前见过的状态序列,并基于新颖性对其给予奖励;新颖性使用已在先前发现的策略的状态序列上训练的自编码器来度量。我们提出了一种用于策略梯度算法的双目标更新技术,其中策略的每次更新都是改善任务奖励与改善新颖性奖励之间的折中。使用该方法,我们最终得到一组解决给定任务的策略,且执行彼此不同的动作序列。我们在迷宫导航任务、模拟机械臂的到达任务以及跳跃者的运动任务上演示了该方法。我们还展示了我们的方法在欺骗性任务上的有效性,这类任务中策略梯度方法常常陷入停滞。

关键词

引用

@article{arxiv.1905.05252,
  title  = {Learning Novel Policies For Tasks},
  author = {Yunbo Zhang and Wenhao Yu and Greg Turk},
  journal= {arXiv preprint arXiv:1905.05252},
  year   = {2020}
}

备注

8 pages, Accepted ICML 2019