基于在线与离线策略的单调策略改进
人工智能
2017-11-02 v2 机器学习
机器学习
摘要
单调策略改进与离线策略学习是强化学习算法的两个主要理想性质。本文中, 通过下界估计两个策略的性能差异, 我们证明了从在线与离线混合样本中可以保证单调策略改进。应用所提出下界的优化过程可视为一种离线自然策略梯度方法。为支持该理论结果, 我们提供了一种使用经验回放的信任域策略优化方法作为该下界的朴素应用, 并在两个经典基准问题上评估了其性能。
引用
@article{arxiv.1710.03442,
title = {On- and Off-Policy Monotonic Policy Improvement},
author = {Ryo Iwaki and Minoru Asada},
journal= {arXiv preprint arXiv:1710.03442},
year = {2017}
}