基于 AMIGo 的学习:对抗性驱动的内在目标
机器学习
2021-02-24 v2 人工智能
机器学习
摘要
强化学习(RL)的一个关键挑战在于在具有稀疏外部奖励的环境中进行学习。与当前的 RL 方法不同,人类能够通过使用各种形式的内在动机,在很少或没有奖励的情况下学习新技能。我们提出了 AMIGo,这是一种新颖的智能体,它以元学习的形式引入了一个目标生成教师,该教师在不存在环境奖励(或伴随环境奖励)的情况下,提出对抗性驱动的内在目标来训练目标条件的“学生”策略。具体而言,通过一个简单但有效的“构造性对抗”目标,教师学会提出日益具有挑战性但可实现的目标,使得学生能够学习在新环境中行动的通用技能,而与待解决的任务无关。我们表明,我们的方法生成了一种由自我提出目标构成的自然课程,最终使得智能体能够解决具有挑战性的程序化生成任务,而其他形式的内在动机和最先进的 RL 方法在这些任务上均告失败。
引用
@article{arxiv.2006.12122,
title = {Learning with AMIGo: Adversarially Motivated Intrinsic Goals},
author = {Andres Campero and Roberta Raileanu and Heinrich Küttler and Joshua B. Tenenbaum and Tim Rocktäschel and Edward Grefenstette},
journal= {arXiv preprint arXiv:2006.12122},
year = {2021}
}
备注
18 pages, 6 figures, published at The Ninth International Conference on Learning Representations (2021)