面向离策略 Actor-Critic 方法的在线元评论家学习
机器学习
2020-11-03 v2 机器学习
摘要
离策略 Actor-Critic(Off-PAC)方法已在多种连续控制任务中证明成功。通常,评论家的动作值函数使用时序差分更新,而评论家转而为演员提供一个损失,训练其采取具有更高期望回报的动作。在本文中,我们引入一种新颖且灵活的元评论家,它观察学习过程并元学习一个额外的演员损失,从而加速并改善 actor-critic 学习。与朴素评论家相比,元评论家网络被显式训练以加速学习过程;而与现有元学习算法相比,元评论家是针对单一任务在线快速学习,而非在一族任务上缓慢学习。关键在于,我们的元评论家框架是为基于离策略的学习器设计的,其目前提供了最先进的强化学习样本效率。我们证明,当与当代 Off-PAC 方法 DDPG、TD3 以及最先进的 SAC 结合时,在线元评论家学习在多种连续控制环境中带来了改进。
引用
@article{arxiv.2003.05334,
title = {Online Meta-Critic Learning for Off-Policy Actor-Critic Methods},
author = {Wei Zhou and Yiying Li and Yongxin Yang and Huaimin Wang and Timothy M. Hospedales},
journal= {arXiv preprint arXiv:2003.05334},
year = {2020}
}
备注
NeurIPS 2020