预测-校正策略优化
机器学习
2019-05-28 v2 机器学习
摘要
我们提出了一个称为 PicCoLO 的预测-校正框架,它可以将一阶无模型强化或模仿学习算法转化为一种利用预测模型加速策略学习的新混合方法。这种新的“PicCoLOed”算法通过递归重复两步来优化策略:在预测步中,学习器使用模型预测未见过的未来梯度,然后应用预测估计来更新策略;在校正步中,学习器在环境中运行更新后的策略,接收真实梯度,然后利用梯度误差校正策略。与以往的算法不同,PicCoLO 校正了使用不完美预测梯度所带来的错误,因此不会受到模型偏差的影响。PicCoLO 的发展得益于一种从可预测在线学习到对抗在线学习的新型归约,该归约为修改现有的一阶算法以利用可预测信息实现最优遗憾提供了系统方法。我们在理论和仿真中都表明,若干一阶无模型算法的收敛速度可以通过 PicCoLO 得到提升。
引用
@article{arxiv.1810.06509,
title = {Predictor-Corrector Policy Optimization},
author = {Ching-An Cheng and Xinyan Yan and Nathan Ratliff and Byron Boots},
journal= {arXiv preprint arXiv:1810.06509},
year = {2019}
}