中文

方差缩减的离策略 TDC 学习:非渐近收敛分析

机器学习 2023-05-23 v4 最优化与控制

摘要

方差缩减技术已成功应用于时序差分(TD)学习,并有助于改善策略评估中的样本复杂度。然而,现有工作要么将方差缩减应用于不太流行的单时间尺度 TD 算法,要么应用于双时间尺度 GTD 算法但仅使用有限数量的独立同分布样本,且这两种算法都仅适用于同策略设定。在本工作中,我们为离策略设定下的双时间尺度 TDC 算法开发了方差缩减方案,并分析了其在独立同分布和马尔可夫样本下的非渐近收敛速率。在独立同分布设定下,我们的算法匹配已知最佳下界 O~(ϵ1\tilde{O}(\epsilon^{-1})。在马尔可夫设定下,我们的算法达到了最先进的样本复杂度 O(ϵ1logϵ1)O(\epsilon^{-1} \log {\epsilon}^{-1}),该复杂度近乎最优。实验表明,所提出的方差缩减 TDC 比传统 TDC 和方差缩减 TD 都实现了更小的渐近收敛误差。

关键词

引用

@article{arxiv.2010.13272,
  title  = {Variance-Reduced Off-Policy TDC Learning: Non-Asymptotic Convergence Analysis},
  author = {Shaocong Ma and Yi Zhou and Shaofeng Zou},
  journal= {arXiv preprint arXiv:2010.13272},
  year   = {2023}
}

备注

Accepted for publication in NeurIPS 2020