一种用于深度强化学习的人类混合策略方法
机器学习
2019-07-30 v1 人工智能
机器学习
摘要
2015年,谷歌的 DeepMind 宣布在基于深度强化学习(DRL)的自主智能体研发上取得进展,该智能体能在一系列 49 款 Atari 游戏中击败职业玩家。然而,当前 DRL 的形态仍不成熟,且存在显著缺陷。DRL 的不完善之处之一是在训练过程中缺乏“探索”,尤其是在处理高维问题时。本文提出一种模拟人类与环境交互行为的混合策略方法,并创建一个“会思考”的智能体,以在 DRL 训练过程中实现更高效的探索。基于 Breakout 游戏的仿真结果表明,我们的方案比基线 DRL 算法(即异步优势 actor-critic 方法)获得最高分的概率更高。因此,所提方案可有效应用于解决现实应用中的复杂任务。
引用
@article{arxiv.1804.01874,
title = {A Human Mixed Strategy Approach to Deep Reinforcement Learning},
author = {Ngoc Duy Nguyen and Saeid Nahavandi and Thanh Nguyen},
journal= {arXiv preprint arXiv:1804.01874},
year = {2019}
}