用于参数化动作空间深度强化学习的多遍 Q 网络
机器学习
2019-05-14 v1 机器学习
摘要
强化学习中的参数化动作由带有连续动作参数的离散动作组成。这为求解需要结合高层动作与灵活控制的复杂领域提供了框架。近期的 P-DQN 算法扩展了深度 Q 网络以在此类动作空间上学习。然而,它将所有动作参数作为 Q 网络的单一联合输入,使其理论基础失效。我们分析了该方法的问题并提出了一种新方法,即多遍深度 Q 网络(multi-pass deep Q-networks,MP-DQN)来解决这些问题。我们经实验证明,在 Platform、Robot Soccer Goal 和 Half Field Offense 领域,MP-DQN 在数据效率和收敛策略性能方面显著优于 P-DQN 及其他先前算法。
引用
@article{arxiv.1905.04388,
title = {Multi-Pass Q-Networks for Deep Reinforcement Learning with Parameterised Action Spaces},
author = {Craig J. Bester and Steven D. James and George D. Konidaris},
journal= {arXiv preprint arXiv:1905.04388},
year = {2019}
}
备注
8 pages, 4 figures