中文

线性函数逼近下 TD 学习的简单有限时间分析

机器学习 2024-06-27 v2 系统与控制 系统与控制 最优化与控制

摘要

我们研究了马尔可夫采样下具有线性函数逼近的 TD 学习的有限时间收敛性。针对该设置的现有证明要么假设算法中包含投影步骤以简化分析,要么需要相当复杂的论证以确保迭代的稳定性。我们提出疑问:\textit{是否可能在不实际执行算法投影步骤的情况下,保留基于投影分析的简洁性?} 我们的主要贡献是通过一种新颖的两步论证证明了这是可行的。第一步,我们使用归纳法证明,在标准的常数步长 α\alpha 选择下,TD 学习生成的迭代在期望上保持一致有界。第二步,我们建立了一个递归关系,该关系模拟了 TD 学习的稳态动态,直至一个量级为 O(α2)O(\alpha^2) 的有界扰动,该扰动捕捉了马尔可夫采样的影响。结合这些部分得出了一种整体方法,极大地简化了现有的证明。我们推测,我们的归纳证明技术将应用于更复杂的随机逼近算法的分析中,并在最后提供了一些此类应用的示例。

关键词

引用

@article{arxiv.2403.02476,
  title  = {A Simple Finite-Time Analysis of TD Learning with Linear Function Approximation},
  author = {Aritra Mitra},
  journal= {arXiv preprint arXiv:2403.02476},
  year   = {2024}
}