非平稳与竞争环境下的元学习持续适应
机器学习
2018-02-26 v2 人工智能
摘要
在非平稳环境中从有限经验中持续学习与适应的能力,是迈向通用智能的重要里程碑。在本文中,我们将持续适应问题转化为“学习如何学习”框架。我们开发了一种简单的基于梯度的元学习算法,适用于动态变化与对抗场景中的适应。此外,我们设计了一个新的多智能体竞争环境 RoboSumo,并定义了迭代适应博弈,用于测试持续适应策略的各个方面。我们证明,在少样本情形下,元学习比反应式基线能够实现显著更高效的适应。我们对一个学习并竞争的智能体群体进行的实验表明,元学习者是最适者。
引用
@article{arxiv.1710.03641,
title = {Continuous Adaptation via Meta-Learning in Nonstationary and Competitive Environments},
author = {Maruan Al-Shedivat and Trapit Bansal and Yuri Burda and Ilya Sutskever and Igor Mordatch and Pieter Abbeel},
journal= {arXiv preprint arXiv:1710.03641},
year = {2018}
}
备注
Published as a conference paper at ICLR 2018