结合监督、自编码器与价值损失联合预训练的深度强化学习
机器学习
2019-04-05 v1 机器学习
摘要
深度强化学习(DRL)算法以数据低效著称。一个原因是 DRL 智能体从零开始学习特征和策略。将先验知识整合进 DRL 算法是提高学习效率的一种途径,因为它有助于构建有用的表示。在这项工作中,我们考虑通过预训练少量非专家人类演示来加速异步优势 actor-critic(A3C)算法,从而融入人类知识。我们利用监督自编码器框架,提出了一种新颖的预训练策略,联合训练加权监督分类损失、无监督重构损失和期望回报损失。所得的预训练模型相比以监督或无监督方式独立训练学到了更有用的特征。我们的预训练方法大幅提升了 A3C 智能体在 Atari 游戏 Pong 和 MsPacman 中的学习表现,在以少得多的游戏交互次数下超越了最先进算法的性能。我们的方法轻量且易于在单机上实现。为可复现性,我们的代码见 github.com/gabrieledcjr/DeepRL/tree/A3C-ALA2019。
引用
@article{arxiv.1904.02206,
title = {Jointly Pre-training with Supervised, Autoencoder, and Value Losses for Deep Reinforcement Learning},
author = {Gabriel V. de la Cruz and Yunshu Du and Matthew E. Taylor},
journal= {arXiv preprint arXiv:1904.02206},
year = {2019}
}
备注
Accepted in Adaptive and Learning Agents (ALA) Workshop at AAMAS