中文

具有恒定与缓慢递减步长的约束强调时序差分学习的弱收敛性质

机器学习 2017-01-23 v3

摘要

我们考虑强调时序差分(TD)算法ETD(λ\lambda),用于在学习折扣、有限状态和动作马尔可夫决策过程中平稳策略的值函数。ETD(λ\lambda)算法最近由Sutton、Mahmood和White提出,以解决标准TD算法应用于离策略训练(即使用来自探索性策略的数据来评估其他感兴趣的策略)时的长期发散问题。ETD(λ\lambda)的几乎必然收敛性已在我们的近期工作中在一般离策略训练条件下证明,但仅针对狭窄的递减步长范围。本文给出了具有恒定步长及来自宽泛范围的递减步长的ETD(λ\lambda)约束版本的收敛结果。我们的结果刻画了这些算法产生的迭代轨迹的渐近行为,是通过结合ETD(λ\lambda)的关键性质与随机逼近理论中弱收敛方法的强有力收敛定理推导得到的。对于恒定步长情况,除了分析步长参数趋于零时算法的极限行为外,我们还分析了固定步长下的行为,并限定其平均迭代与期望解的偏差。这些结果通过利用与算法关联的马尔可夫链的弱Feller性质,以及使用弱Feller马尔可夫链的遍历定理,并结合我们从弱收敛方法得到的收敛结果而获得。除ETD(λ\lambda)外,当通过设置足够大的λ\lambda避免发散问题时,我们的分析也适用于离策略TD(λ\lambda)算法。

关键词

引用

@article{arxiv.1511.07471,
  title  = {Weak Convergence Properties of Constrained Emphatic Temporal-difference Learning with Constant and Slowly Diminishing Stepsize},
  author = {Huizhen Yu},
  journal= {arXiv preprint arXiv:1511.07471},
  year   = {2017}
}

备注

Minor edits; 53 pages. Longer and more proof details than the journal version