通过通才-专才学习改进策略优化
机器学习
2022-06-28 v1
摘要
深度强化学习在未见环境变化上的泛化通常需要在大量多样化训练变化上进行策略学习。我们通过实验观察到,在多种变化上训练的智能体(通才)往往在初期学习更快,但其性能长时间停滞在较不最优的水平。相比之下,仅在少量变化上训练的智能体(专才)常能在有限计算预算下取得高回报。为兼得二者之长,我们提出了一种新颖的通才-专才训练框架。具体而言,我们首先在所有环境变化上训练一个通才;当其无法继续提升时,我们启动一大群专才,其权重从通才克隆而来,每个专才训练以掌握所选的小子集变化。最后,我们利用所有专才演示所诱导的辅助奖励恢复通才的训练。特别地,我们研究了启动专才训练的时机,并比较了在专才辅助下学习通才的策略。我们表明该框架在包括Procgen、Meta-World和ManiSkill在内的若干具挑战性且流行的基准上推进了策略学习的边界。
引用
@article{arxiv.2206.12984,
title = {Improving Policy Optimization with Generalist-Specialist Learning},
author = {Zhiwei Jia and Xuanlin Li and Zhan Ling and Shuang Liu and Yiran Wu and Hao Su},
journal= {arXiv preprint arXiv:2206.12984},
year = {2022}
}
备注
ICML 2022