中文

函数近似下的收敛性Tree Backup与Retrace算法

机器学习 2019-01-04 v4

摘要

离策略学习是扩展强化学习的关键,因为它允许从不同行为策略产生的经验中学习目标策略。不幸的是,将离策略学习与函数近似和多步自举相结合,以得到既稳定又高效的算法一直具有挑战性。在这项工作中,我们从理论上和通过具体实例在实践中证明,Tree Backup和Retrace算法在线性函数近似下是不稳定的。基于我们的分析,我们随后利用二次凸-凹鞍点公式推导出稳定且高效的基于梯度的算法。通过利用这些算法特有的问题结构,我们能够提供收敛性保证和有限样本界。我们新分析的适用范围也超越了Tree Backup和Retrace,使我们能够为GTD和GTD2算法提供新的收敛速率,而无需借助投影或Polyak平均。

关键词

引用

@article{arxiv.1705.09322,
  title  = {Convergent Tree Backup and Retrace with Function Approximation},
  author = {Ahmed Touati and Pierre-Luc Bacon and Doina Precup and Pascal Vincent},
  journal= {arXiv preprint arXiv:1705.09322},
  year   = {2019}
}