面向策略内优化的连续动作空间离散化
机器学习
2020-03-23 v4 人工智能
摘要
在这项工作中,我们表明对连续控制离散化动作空间是一种简单而强大的策略内(on-policy)优化技术。离散动作数量的爆炸式增长可通过在动作维度上具有因子化分布的策略来有效解决。我们表明,离散策略在具有复杂动力学的高维任务上,借助最先进的策略内优化算法(PPO、TRPO、ACKTR)取得了显著的性能提升。此外,我们表明离散分布的序数参数化可以引入编码离散动作之间自然排序的归纳偏置。该序数架构进一步显著提升了 PPO/TRPO 的性能。
引用
@article{arxiv.1901.10500,
title = {Discretizing Continuous Action Space for On-Policy Optimization},
author = {Yunhao Tang and Shipra Agrawal},
journal= {arXiv preprint arXiv:1901.10500},
year = {2020}
}
备注
Accepted at AAAI Conference on Artificial Intelligence (2020) in New York, NY, USA. An open source implementation can be found at https://github.com/robintyh1/onpolicybaselines