中文

面向无参数时序差学习的探索

机器学习 2026-03-04 v1

摘要

时序差(TD)学习是强化学习中估计价值函数的基本算法。 recent finite-time analyses of TD with linear function approximation量化了其理论收敛率,但往往需要设置使用难以在实践中估计的算法参数——如特征协方�矩阵的最小特征值(ω)或底层马尔可夫链的混合时间(τ_mix)。此外,一些分析依赖非标准且不切实际的修改,加剧了理论与实践之间的差距。为此,我们采用标准TD(0)算法的指数步长方案。我们在两种抽样方案下进行分析:独立同分布(i.i.d.)从平稳分布抽样,以及沿单一轨迹的马尔可夫抽样。 在i.i.d.设置下,所提算法无需知道ω,实现最后一步的最优偏差-方差权衡。 在马尔可夫设置下,我们提出带指数步长的正则化TD(0)算法。该算法在收敛率上与先前工作相当,且无需投影、迭代平均或知道τ_mix或ω。

关键词

引用

@article{arxiv.2603.02576,
  title  = {Wasserstein Proximal Policy Gradient},
  author = {Zhaoyu Zhu and Shuhan Zhang and Rui Gao and Shuang Li},
  journal= {arXiv preprint arXiv:2603.02576},
  year   = {2026}
}