利用人类演示预训练神经网络用于深度强化学习
机器学习
2019-04-09 v2 人工智能
摘要
深度强化学习(deep RL)通过使用深度神经网络作为函数逼近器并直接从原始图像学习,在复杂序列任务中取得了优越性能。使用原始图像的一个缺点是,深度RL除了学习策略外,还必须从原始图像中学习状态特征表示。因此,深度RL可能需要极其大量的训练时间和数据才能达到合理性能,这使得深度RL难以在现实应用中使用,尤其在数据昂贵时。本工作中,我们通过解决深度RL试图解决的一半问题——学习特征,来加速训练。我们的方法是通过监督学习利用一小批人类演示来预训练深度RL网络的隐藏层,从而学习一些重要特征。我们使用深度Q网络(DQN)和异步优势行动者-评论家(A3C)算法在Atari 2600游戏Pong、Freeway和Beamrider上实证评估了我们的方法。结果表明:1)以监督学习方式利用人类演示进行预训练比在DQN中朴素预训练更能发现特征;2)即使从少量人类演示预训练,用预训练模型初始化深度RL网络也能在训练时间上提供显著改进。
引用
@article{arxiv.1709.04083,
title = {Pre-training Neural Networks with Human Demonstrations for Deep Reinforcement Learning},
author = {Gabriel V. de la Cruz and Yunshu Du and Matthew E. Taylor},
journal= {arXiv preprint arXiv:1709.04083},
year = {2019}
}
备注
ALA 2018