用标准化流策略提升信赖域策略优化
人工智能
2019-02-04 v3 机器学习
机器学习
摘要
我们提出用标准化流(normalizing flows)策略改进信赖域策略搜索。我们说明当信赖域由 KL 散度约束构造时,标准化流策略生成的样本远离先前策略迭代的“中心”,这潜在地实现了更好的探索并有助于避免糟糕的局部最优。通过大量对比,我们表明标准化流策略显著优于基线架构,尤其是在具有复杂动态的高维任务上。
引用
@article{arxiv.1809.10326,
title = {Boosting Trust Region Policy Optimization by Normalizing Flows Policy},
author = {Yunhao Tang and Shipra Agrawal},
journal= {arXiv preprint arXiv:1809.10326},
year = {2019}
}