中文

强调型TD贝尔曼算子是收缩算子

机器学习 2015-08-25 v2 机器学习

摘要

最近,\citet{SuttonMW15} 引入了强调型时序差分(ETD)算法,用于马尔可夫决策过程中的离策略评估。在本短文中,我们证明了支撑 ETD 的投影不动点方程涉及一个收缩算子,其收缩模为 γ\sqrt{\gamma}(其中 γ\gamma 是折扣因子)。这使我们能够提供 ETD 近似误差的误差界。据我们所知,这些是在一般目标策略和行为策略下离策略评估算法的首个误差界。

关键词

引用

@article{arxiv.1508.03411,
  title  = {Emphatic TD Bellman Operator is a Contraction},
  author = {Assaf Hallak and Aviv Tamar and Shie Mannor},
  journal= {arXiv preprint arXiv:1508.03411},
  year   = {2015}
}