参数化深度Q网络学习:面向离散-连续混合动作空间的强化学习
机器学习
2018-10-16 v1 人工智能
机器学习
摘要
大多数现有的深度强化学习(DRL)框架仅考虑离散动作空间或连续动作空间。受计算机游戏应用的启发,我们考虑具有离散-连续混合动作空间的情形。为处理混合动作空间,已有工作或通过离散化近似混合空间,或将其松弛为连续集合。本文中,我们提出一种用于混合动作空间的参数化深度Q网络(P-DQN)框架,无需近似或松弛。我们的算法通过无缝集成DQN(处理离散动作空间)和DDPG(处理连续动作空间)的思想,结合了二者的精髓。在模拟示例、模拟RoboCup足球中进球以及游戏王者荣耀(KOG)单人模式上的实证结果验证了我们方法的效率与有效性。
引用
@article{arxiv.1810.06394,
title = {Parametrized Deep Q-Networks Learning: Reinforcement Learning with Discrete-Continuous Hybrid Action Space},
author = {Jiechao Xiong and Qing Wang and Zhuoran Yang and Peng Sun and Lei Han and Yang Zheng and Haobo Fu and Tong Zhang and Ji Liu and Han Liu},
journal= {arXiv preprint arXiv:1810.06394},
year = {2018}
}