面向基于模型强化学习的模型模仿
机器学习
2020-03-17 v3 人工智能
机器学习
摘要
基于模型的强化学习(MBRL)旨在学习动态模型以减少与真实世界环境的交互次数。然而,由于估计误差,在所学模型中的展开(尤其是长时域展开)无法匹配真实世界环境中的展开。这种失配严重影响了 MBRL 的样本复杂度。该现象可归因于以往工作采用监督学习来学习单步转移模型,其固有地难以保证多步展开分布的一致性。基于这一论断,我们提出通过 WGAN 匹配从转移模型与真实转移采样得到的多步展开分布来学习转移模型。我们从理论上证明,匹配二者可最小化真实转移与所学转移之间累积奖励的差异。我们的实验也表明,所提出的模型模仿方法在样本复杂度与平均回报方面可与最先进方法竞争或优于之。
引用
@article{arxiv.1909.11821,
title = {Model Imitation for Model-Based Reinforcement Learning},
author = {Yueh-Hua Wu and Ting-Han Fan and Peter J. Ramadge and Hao Su},
journal= {arXiv preprint arXiv:1909.11821},
year = {2020}
}