双重元学习用于非平稳环境中数据高效策略优化
机器学习
2020-11-24 v1 人工智能
摘要
我们关注非平稳环境模型的构建,其可视为一个多任务学习问题。无模型强化学习算法在多任务学习中能取得良好的渐近性能,但因其从零开始学习的方式,需付出大量采样的代价。尽管基于模型的方法是最具数据效率的学习算法之一,它们仍难以应对复杂任务与模型不确定性。元强化学习通过快速利用新任务的元先验策略,解决了多任务学习中的效率与泛化挑战。本文提出一种元强化学习方法,用于学习非平稳环境的动态模型,以供后续的元策略优化使用。基于模型学习方法的采样高效性,我们能够在动态模型收敛前同时训练非平稳环境的元模型与元策略。随后,环境的元学习动态模型将生成模拟数据用于元策略优化。实验表明,所提方法能在非平稳环境中以基于模型学习方法的采样效率元学习策略,同时达到无模型元强化学习的较高渐近性能。
引用
@article{arxiv.2011.10714,
title = {Double Meta-Learning for Data Efficient Policy Optimization in Non-Stationary Environments},
author = {Elahe Aghapour and Nora Ayanian},
journal= {arXiv preprint arXiv:2011.10714},
year = {2020}
}
备注
8 pages, 4 figures