中文

一种用于策略优化的随机信赖域框架

最优化与控制 2019-11-27 v1

摘要

本文研究了深度强化学习中著名的信赖域策略优化所面临的一些具有挑战性的理论与数值问题。目标是找到一种策略,使智能体依该策略行动时的总期望奖励最大化。信赖域子问题由与总期望奖励一致的替代函数以及围绕最新策略的一般距离约束构造。我们采用预条件随机梯度法并配合线搜索方案求解该子问题,以确保每一步均提升模型函数且停留在信赖域内。为克服随机设定下采样对函数估计带来的偏差,我们在比率中将总期望奖励的经验标准差加入预测增量,以更新信赖域半径并决定是否接受试验点。此外,对于连续动作空间中常用的高斯策略,对均值与协方差的极大化分别进行以控制熵损失。理论分析表明,所提算法的确定性版本倾向于产生总期望奖励的单调改进,且在适度假设下保证全局收敛。与最先进方法的对比证明了我们的方法在 OpenAI Gym 的机器人控制与游戏任务上的有效性与鲁棒性。

关键词

引用

@article{arxiv.1911.11640,
  title  = {A Stochastic Trust-Region Framework for Policy Optimization},
  author = {Mingming Zhao and Yongfeng Li and Zaiwen Wen},
  journal= {arXiv preprint arXiv:1911.11640},
  year   = {2019}
}

备注

26pages