用于深度强化学习的动作分支架构
机器学习
2019-01-28 v2 人工智能
摘要
离散动作算法一直是深度强化学习近期众多成功的核心。然而,将这些算法应用于高维动作任务需要应对可能动作数量随动作维数组合式增长的问题。对于需要通过离散化对动作进行精细控制的连续动作任务,该问题进一步加剧。本文中,我们提出一种新颖的神经网络架构,其特征是共享决策模块后接若干网络分支,每个动作维度对应一个分支。该方法通过允许每个独立动作维度具有一定独立性,实现了网络输出数量随自由度数量的线性增长。为说明该方法,我们提出一种称为分支对决Q网络(Branching Dueling Q-Network, BDQ)的新智能体,作为对决双重深度Q网络(Dueling Double Deep Q-Network, Dueling DDQN)的分支变体。我们在一组具有挑战性的连续控制任务上评估了智能体的性能。实证结果表明,所提智能体随动作维度增加的环境优雅地扩展,并表明共享决策模块在协调分布式动作分支方面的重要性。此外,我们展示了所提智能体相对于最先进的连续控制算法——深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)具有竞争力。
引用
@article{arxiv.1711.08946,
title = {Action Branching Architectures for Deep Reinforcement Learning},
author = {Arash Tavakoli and Fabio Pardo and Petar Kormushev},
journal= {arXiv preprint arXiv:1711.08946},
year = {2019}
}
备注
AAAI 2018, NIPS 2017 Deep RL Symposium, code: https://github.com/atavakol/action-branching-agents