带离策略修正的 Q($\lambda$)
人工智能
2016-08-12 v2 机器学习
机器学习
摘要
我们提出并分析了离策略多步时序差分学习的一种替代方法,其中离策略回报根据奖励用当前Q函数进行修正,而不是根据转移概率用目标策略修正。我们证明了在策略评估和控制中,只要满足特定条件,此类近似修正足以保证离策略收敛。这些条件关联了目标策略与行为策略之间的距离、资格迹参数和折扣因子,并形式化了离策略 TD() 中潜在的权衡。我们在连续状态控制任务上通过经验说明了这一理论关系。
引用
@article{arxiv.1602.04951,
title = {Q($\lambda$) with Off-Policy Corrections},
author = {Anna Harutyunyan and Marc G. Bellemare and Tom Stepleton and Remi Munos},
journal= {arXiv preprint arXiv:1602.04951},
year = {2016}
}