面向更快训练且不遗忘的因子化策略终身策略梯度学习
机器学习
2020-10-23 v2 人工智能
机器学习
摘要
策略梯度方法在学习高维动力系统的控制策略方面已取得成功。其最大缺点是在产生高性能策略之前需要大量探索。在终身学习设定中,智能体在其生命周期内面对多个连续任务,重用先前所见任务的信息可大幅加速新任务的学习。我们提供了一种新颖的终身策略梯度学习方法,该方法通过策略梯度直接训练终身函数逼近器,使智能体能在整个训练过程中受益于积累的知识。我们通过实验证明,我们的算法比单任务和终身学习基线学习更快、收敛到更优策略,并在多种具有挑战性的领域完全避免了灾难性遗忘。
引用
@article{arxiv.2007.07011,
title = {Lifelong Policy Gradient Learning of Factored Policies for Faster Training Without Forgetting},
author = {Jorge A. Mendez and Boyu Wang and Eric Eaton},
journal= {arXiv preprint arXiv:2007.07011},
year = {2020}
}
备注
To appear in Advances in Neural Information Processing Systems 33 (NeurIPS-20)