经验回放优化
机器学习
2019-06-21 v1 机器学习
摘要
经验回放使强化学习智能体能够记忆并重用过往经验,正如人类针对当前情境重放记忆。当代离策略算法要么均匀回放过往经验,要么利用基于规则的回放策略,这可能并非最优。在本工作中,我们考虑学习一个回放策略以优化累积奖励。回放学习具有挑战性,因为回放记忆噪声大且规模大,且累积奖励不稳定。为解决这些问题,我们提出了一种新颖的经验回放优化(ERO)框架,其交替更新两种策略:智能体策略与回放策略。智能体基于回放数据更新以最大化累积奖励,而回放策略更新以为智能体提供最有用的经验。在多种连续控制任务上进行的实验证明了 ERO 的有效性,从经验上展示了经验回放学习在提升离策略强化学习算法性能方面的潜力。
引用
@article{arxiv.1906.08387,
title = {Experience Replay Optimization},
author = {Daochen Zha and Kwei-Herng Lai and Kaixiong Zhou and Xia Hu},
journal= {arXiv preprint arXiv:1906.08387},
year = {2019}
}