中文

通过非对称自博弈实现内在动机与自动课程

机器学习 2018-05-01 v5

摘要

我们描述了一种简单的方案,允许智能体以无监督的方式了解其环境。我们的方案使同一智能体的两个版本,Alice 和 Bob,相互对抗。Alice 为 Bob 提出一个需要完成的任务;然后 Bob 尝试完成该任务。在本工作中,我们将关注两种环境:(几乎)可逆环境和可重置环境。Alice 通过执行一系列动作来“提出”任务,然后 Bob 必须分别撤销或重复这些动作。通过适当的奖励结构,Alice 和 Bob 自动生成探索课程,从而实现智能体的无监督训练。当 Bob 被部署到环境中的强化学习(RL)任务时,这种无监督训练减少了学习所需的监督回合数,并在某些情况下收敛到更高的奖励。

关键词

引用

@article{arxiv.1703.05407,
  title  = {Intrinsic Motivation and Automatic Curricula via Asymmetric Self-Play},
  author = {Sainbayar Sukhbaatar and Zeming Lin and Ilya Kostrikov and Gabriel Synnaeve and Arthur Szlam and Rob Fergus},
  journal= {arXiv preprint arXiv:1703.05407},
  year   = {2018}
}

备注

Published in ICLR 2018