通过模仿多个预言机实现策略改进
机器学习
2020-12-08 v2 人工智能
机器学习
摘要
尽管前景广阔,强化学习的实际采用因需要昂贵的探索来学习良好策略而受阻。模仿学习(IL)通过在训练期间使用预言机策略作为引导来加速学习过程,从而缓解这一缺陷。然而,在许多实际情况下,学习者可访问多个次优预言机,它们可能在某一状态下给出冲突的建议。现有IL文献对这类情形的处理有限。在单预言机情形下,预言机策略的回报为学习者提供了一个明显的竞争基准;而对于多预言机设定,既无此类基准,也无超越它的原则性方法。本文提出以预言机策略价值的状态明智最大值作为解决多预言机冲突建议的自然基线。利用策略优化到在线学习的归约,我们引入了一种新颖的IL算法MAMBA,可证明地学习出与该基线竞争的策略。特别地,MAMBA通过使用广义优势估计(GAE)风格的梯度估计器来优化策略。我们的理论分析表明,该设计使MAMBA具有鲁棒性,并使其即使在单预言机情形下也能比IL最先进水平更大程度地超越预言机策略。在与使用GAE的标准策略梯度和AggreVaTe(D)的评估中,我们展示了MAMBA利用来自单个及多个弱预言机的演示并显著加速策略优化的能力。
引用
@article{arxiv.2007.00795,
title = {Policy Improvement via Imitation of Multiple Oracles},
author = {Ching-An Cheng and Andrey Kolobov and Alekh Agarwal},
journal= {arXiv preprint arXiv:2007.00795},
year = {2020}
}