利用非专家人类演示进行深度强化学习的预训练
机器学习
2019-07-31 v1 人工智能
机器学习
摘要
深度强化学习(deep RL)通过使用深度神经网络作为函数逼近器直接从原始输入图像学习,在复杂序列任务中取得了优越性能。然而,直接从原始图像学习是数据低效的。智能体除了学习策略外,还必须学习复杂状态的特征表示。因此,深度 RL 通常学习速度慢,且往往需要 prohibitively 大量的训练时间和数据才能达到合理性能,使其不适用于数据昂贵的真实场景。在这项工作中,我们通过解决两个学习目标之一即特征学习,来提高深度 RL 的数据效率。我们利用监督学习在一小组非专家人类演示上预训练,并在 Atari 领域使用异步优势 actor-critic 算法(A3C)对我们的方法进行经验评估。我们的结果显示,即使所提供的演示含噪且质量低,学习速度也有显著提升。
引用
@article{arxiv.1812.08904,
title = {Pre-training with Non-expert Human Demonstration for Deep Reinforcement Learning},
author = {Gabriel V. de la Cruz and Yunshu Du and Matthew E. Taylor},
journal= {arXiv preprint arXiv:1812.08904},
year = {2019}
}