基于模型的策略梯度评论家元学习
机器学习
2022-04-06 v1 人工智能
摘要
能够无缝地跨不同任务泛化是机器人在真实世界中行动的基础。然而,学习能快速泛化到新场景的表示仍是强化学习中的一个开放研究问题。在本文中,我们提出了一个用于元学习基于梯度的策略学习之评论家的框架。具体而言,我们提出了一种基于模型的双层优化算法,该算法更新评论家参数,使得用更新后评论家学习到的策略更接近于解决元训练任务。我们说明我们的算法得到的习得评论家类似于给定任务的真实Q函数。最后,在元训练之后,习得的评论家可用于通过无模型策略梯度优化为新未见过的任务和环境设置学习新策略,而无需模型。我们给出的结果显示了当用于在新场景中学习新策略时,我们习得评论家对新任务和新动力学的泛化能力。
引用
@article{arxiv.2204.02210,
title = {Model Based Meta Learning of Critics for Policy Gradients},
author = {Sarah Bechtle and Ludovic Righetti and Franziska Meier},
journal= {arXiv preprint arXiv:2204.02210},
year = {2022}
}