将人类专家的域知识神经编码以预热启动强化学习
机器学习
2020-09-25 v4 人工智能
机器学习
摘要
深度强化学习已在多种任务中取得成功,如游戏博弈与机器人操控。然而,试图从白板(\textit{tabula rasa})开始学习忽视了众多领域的逻辑结构,以及来自领域专家、可帮助“预热启动”学习过程的丰富可用知识。我们提出一种新颖的强化学习技术,允许对神经网络权重与架构进行智能初始化。我们的方法允许将领域知识直接编码进神经决策树,并通过策略梯度更新对该知识加以改进。我们在两个 OpenAI Gym 任务与两个修改后的 StarCraft 2 任务上经实证验证了我们的方法,表明我们的新颖架构优于多层感知机与循环架构。我们基于知识的框架找到了优于基于模仿学习与先前基于知识方法的策略。重要的是,我们证明未受训练的人类可使用我们的方法在训练前初始提供相对于基线预期奖励 >80% 的提升(p < 0.001),这在策略优化后导致预期奖励 >60% 的提升(p = 0.011)。
引用
@article{arxiv.1902.06007,
title = {Neural-encoding Human Experts' Domain Knowledge to Warm Start Reinforcement Learning},
author = {Andrew Silva and Matthew Gombolay},
journal= {arXiv preprint arXiv:1902.06007},
year = {2020}
}