中文

深度 Q 智能体学到的表征可迁移性如何?

机器学习 2020-02-25 v1 机器学习

摘要

在本文中,我们考察深度强化学习(DRL)样本复杂度的来源,探究其中有多少源于学习环境状态有用表征的需求,又有多少归因于学习策略的样本复杂度。尽管对于 DRL 智能体而言,表征与策略的区分可能并不清晰,我们仍试图通过一组迁移学习实验获得新的认识。在每项实验中,我们保留在同一种游戏或相关游戏上训练得到的若干层,将迁移学习的收益与从零开始学习策略进行对比。有趣的是,我们发现迁移带来的收益总体上高度可变,且在任务对之间具有非对称性。我们的实验表明,或许从更简单的环境迁移可以提升在更复杂下游任务上的表现,并且根据环境不同,学习有用表征所需代价在样本复杂度中占比可从可忽略到占绝大部分不等。此外,我们发现微调通常优于冻结迁移层进行训练,这印证了在分类场景中首次指出的一个认识。

关键词

引用

@article{arxiv.2002.10021,
  title  = {How Transferable are the Representations Learned by Deep Q Agents?},
  author = {Jacob Tyo and Zachary Lipton},
  journal= {arXiv preprint arXiv:2002.10021},
  year   = {2020}
}