深度强化学习中连续动作的离散序列预测
机器学习
2019-06-11 v3 人工智能
机器学习
摘要
长期以来,人们认为由于策略必须学习的箱数呈指数级增长,通过离散化动作空间的各个维度无法有效解决高维连续控制问题。在本文中,我们从近期序列到序列(sequence-to-sequence)模型在结构化预测问题上的成功获得启发,以开发离散空间上的策略。该方法的核心在于认识到高维空间上的复杂函数可由一次预测一个维度的神经网络建模。具体而言,我们展示了如何使用离散维度上的下一步预测模型来建模连续空间上的Q值和政策。借助此种参数化,既能在学习过程中利用动作空间的组合结构,也能(近似)计算动作空间上的最大值。在一个简单示例任务上,我们经实验证明该方法能执行全局搜索,从而有效规避困扰DDPG的局部优化问题。我们将该技术应用于离策略(Q-learning)方法,并表明在多个连续控制任务上,我们的方法能取得离策略方法的 state-of-the-art 性能。
引用
@article{arxiv.1705.05035,
title = {Discrete Sequential Prediction of Continuous Actions for Deep RL},
author = {Luke Metz and Julian Ibarz and Navdeep Jaitly and James Davidson},
journal= {arXiv preprint arXiv:1705.05035},
year = {2019}
}