中文

行动者-顾问:带离屏建议的策略梯度

人工智能 2019-02-08 v1

摘要

行动者-评论家算法学习显式策略(行动者)及相应的价值函数(评论家)。行动者在环境中执行动作,而评论家评估行动者当前的策略。然而,尽管具有稳定性和良好的收敛性质,当前的行动者-评论家算法在实践中并未优于仅含评论家的算法。我们认为,评论家学习的是 QπQ^\pi 而非最优 Q 函数 QQ^* 这一事实,阻碍了最先进且鲁棒、样本高效的离屏学习算法的使用。本文提出一种优雅的解决方案——行动者-顾问架构,其中策略梯度行动者从无偏蒙特卡洛回报中学习,同时受离屏评论家产生的 Softmax 策略所塑造(或建议)。评论家可使用任何最先进算法独立于行动者学习。在高品质评论家的建议下,行动者快速且鲁棒地学习任务,而其使用的蒙特卡洛回报有助于克服评论家可能存在的任何偏差。除新的行动者-评论家公式外,行动者-顾问这一允许外部顾问策略塑造策略梯度行动者的方法,可应用于许多其他领域。通过改变建议来源,我们展示了行动者-顾问在强化学习其他三个重要子领域的广泛适用性:带备份策略的安全 RL、领域知识的高效利用以及 RL 中的迁移学习。我们的实验结果证明了行动者-顾问相较于最先进行动者-评论家方法的优势,说明了其在上述三种其他应用场景中的适用性,并表明许多 RL 重要挑战现在可使用单一优雅方案解决。

关键词

引用

@article{arxiv.1902.02556,
  title  = {The Actor-Advisor: Policy Gradient With Off-Policy Advice},
  author = {Hélène Plisnier and Denis Steckelmacher and Diederik M. Roijers and Ann Nowé},
  journal= {arXiv preprint arXiv:1902.02556},
  year   = {2019}
}