线性函数逼近下 TD 学习的简单有限时间分析
机器学习
2024-06-27 v2 系统与控制
系统与控制
最优化与控制
摘要
我们研究了马尔可夫采样下具有线性函数逼近的 TD 学习的有限时间收敛性。针对该设置的现有证明要么假设算法中包含投影步骤以简化分析,要么需要相当复杂的论证以确保迭代的稳定性。我们提出疑问:\textit{是否可能在不实际执行算法投影步骤的情况下,保留基于投影分析的简洁性?} 我们的主要贡献是通过一种新颖的两步论证证明了这是可行的。第一步,我们使用归纳法证明,在标准的常数步长 选择下,TD 学习生成的迭代在期望上保持一致有界。第二步,我们建立了一个递归关系,该关系模拟了 TD 学习的稳态动态,直至一个量级为 的有界扰动,该扰动捕捉了马尔可夫采样的影响。结合这些部分得出了一种整体方法,极大地简化了现有的证明。我们推测,我们的归纳证明技术将应用于更复杂的随机逼近算法的分析中,并在最后提供了一些此类应用的示例。
引用
@article{arxiv.2403.02476,
title = {A Simple Finite-Time Analysis of TD Learning with Linear Function Approximation},
author = {Aritra Mitra},
journal= {arXiv preprint arXiv:2403.02476},
year = {2024}
}