中文

利用散度校正组合最大熵策略

机器学习 2019-07-08 v2 机器学习

摘要

将先前掌握的技能组合起来以解决新任务,有望极大提升强化学习的数据效率。在此,我们分析近期两项以动作值函数形式表示行为并进行组合的工作,表明它们在某些情形下表现不佳。作为该分析的一部分,我们将策略改进的一个重要推广扩展至最大熵框架,并引入一种在连续动作空间中实用实现后继特征(successor features)的算法。随后我们提出一种新方法,解决了先前工作的失效情形,并且在原则上于迁移过程中恢复最优策略。该方法通过显式学习基策略之间的(折扣的、未来的)散度来实现。我们在表格情形以及具有组合结构的非平凡连续控制问题上研究该方法,表明其在所有考虑的任务上均优于或匹配现有方法。

关键词

引用

@article{arxiv.1812.02216,
  title  = {Composing Entropic Policies using Divergence Correction},
  author = {Jonathan J Hunt and Andre Barreto and Timothy P Lillicrap and Nicolas Heess},
  journal= {arXiv preprint arXiv:1812.02216},
  year   = {2019}
}