中文

带离策略修正的 Q($\lambda$)

人工智能 2016-08-12 v2 机器学习 机器学习

摘要

我们提出并分析了离策略多步时序差分学习的一种替代方法,其中离策略回报根据奖励用当前Q函数进行修正,而不是根据转移概率用目标策略修正。我们证明了在策略评估和控制中,只要满足特定条件,此类近似修正足以保证离策略收敛。这些条件关联了目标策略与行为策略之间的距离、资格迹参数和折扣因子,并形式化了离策略 TD(λ\lambda) 中潜在的权衡。我们在连续状态控制任务上通过经验说明了这一理论关系。

关键词

引用

@article{arxiv.1602.04951,
  title  = {Q($\lambda$) with Off-Policy Corrections},
  author = {Anna Harutyunyan and Marc G. Bellemare and Tom Stepleton and Remi Munos},
  journal= {arXiv preprint arXiv:1602.04951},
  year   = {2016}
}