中文

具有线性函数逼近的离策略多步 TD 学习分析

系统与控制 2024-04-09 v2 机器学习 系统与控制

摘要

本文分析了在“致命三元组”场景下的多步 TD 学习算法,该场景以线性函数逼近、离策略学习和自举为特征。特别是,我们证明了当采样视界 nn 充分增加时,nn步 TD 学习算法会收敛到一个解。本文分为两部分。在第一部分中,我们全面考察了其基于模型的确定性对应算法的基本性质,包括投影值迭代、梯度下降算法和控制理论方法,这些可被视为原型确定性算法,对其分析在理解和开发其无模型强化学习对应算法中起着关键作用。特别是,我们证明了当 nn 足够大时,这些算法会收敛到有意义的解。基于这些发现,我们提出并分析了两种nn步 TD 学习算法,它们可被视为梯度算法和控制理论算法的无模型强化学习对应物。

关键词

引用

@article{arxiv.2402.15781,
  title  = {Analysis of Off-Policy Multi-Step TD-Learning with Linear Function Approximation},
  author = {Donghwan Lee},
  journal= {arXiv preprint arXiv:2402.15781},
  year   = {2024}
}