利用二阶优势信息进行策略优化
机器学习
2019-05-30 v2 人工智能
机器学习
摘要
高维连续控制任务上的策略优化因其策略梯度估计量方差过大而显现困难。我们提出动作子空间依赖梯度(ASDG)估计量,将Rao-Blackwell定理(RB)与控制变量法(CV)纳入统一框架以减小方差。为调用RB,我们提出的算法(POSA)基于二阶优势信息学习动作空间下的潜在因子分解结构。POSA利用wide & deep架构显式且高效地捕获二次信息。实证研究表明,我们所提方法在高维合成设定与OpenAI Gym的MuJoCo连续控制任务上均展现出性能提升。
引用
@article{arxiv.1805.03586,
title = {Policy Optimization with Second-Order Advantage Information},
author = {Jiajin Li and Baoxiang Wang},
journal= {arXiv preprint arXiv:1805.03586},
year = {2019}
}
备注
International Joint Conference on Artificial Intelligence (IJCAI) 2018