参数化动作空间中基于分层方法的强化学习
机器学习
2018-10-24 v1 人工智能
机器学习
摘要
我们探索了参数化动作空间中的深度强化学习。具体而言,我们研究如何在这些任务中实现样本高效的端到端训练。我们针对离散动作策略输出所条件的参数策略任务提出了一种新的紧凑架构。我们还基于最先进的算法信赖域策略优化(TRPO)与随机值梯度(SVG)提出了两种新方法来训练此类架构。我们证明这些方法在测试领域上优于最先进的方法Parameterized Action DDPG。
引用
@article{arxiv.1810.09656,
title = {Hierarchical Approaches for Reinforcement Learning in Parameterized Action Space},
author = {Ermo Wei and Drew Wicke and Sean Luke},
journal= {arXiv preprint arXiv:1810.09656},
year = {2018}
}
备注
Accepted in AAAI 18 Spring Symposium