利用学习到的目标函数改进元强化学习中的泛化能力
机器学习
2020-02-17 v2 人工智能
神经与进化计算
机器学习
摘要
生物进化将许多学习者的经验提炼为人类的通用学习算法。我们新颖的元强化学习算法 MetaGenRL 受此过程启发。MetaGenRL 将许多复杂智能体的经验提炼以元学习一个低复杂度的神经目标函数,该函数决定未来个体将如何学习。与近期元 RL 算法不同,MetaGenRL 可泛化到与元训练所用环境完全不同的新环境。在某些情况下,它甚至优于人工设计的 RL 算法。MetaGenRL 在元训练期间使用离策略二阶梯度,极大提升了其样本效率。
引用
@article{arxiv.1910.04098,
title = {Improving Generalization in Meta Reinforcement Learning using Learned Objectives},
author = {Louis Kirsch and Sjoerd van Steenkiste and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:1910.04098},
year = {2020}
}
备注
Accepted to ICLR 2020