中文

分布式时序差分学习的统计效率与 Hilbert 空间中的 Freedman 不等式

机器学习 2025-01-17 v4 机器学习

摘要

分布式强化学习(DRL)在多个领域取得了经验上的成功。DRL 中的一个核心任务是分布式策略评估,即估计给定策略 π\pi 的回报分布 ηπ\eta^\pi。相应地,分布式时序差分学习被提出,它扩展了强化学习中经典的时序差分学习(TD)。本文关注分布式 TD 的非渐近统计速率。为了便于理论分析,我们提出了非参数分布式 TD(NTD)。对于 γ\gamma-折扣无限水平表格 Markov 决策过程,我们证明对于带有生成模型的 NTD,当估计误差由 11-Wasserstein 距离衡量时,我们需要 O~(ε2μmin1(1γ)3)\tilde{O}(\varepsilon^{-2}\mu_{\min}^{-1}(1-\gamma)^{-3}) 次与环境交互才能以高概率获得 ε\varepsilon-最优估计量。该样本复杂度上界在相差对数因子意义下是极小化极大的。此外,我们重新审视了类别分布式 TD(CTD),证明在 11-Wasserstein 距离情况下,相同的非渐近收敛上界对 CTD 也成立。我们还将分析扩展到数据生成过程为 Markov 过程的更一般设定。在 Markov 设定下,我们提出了 NTD 和 CTD 的方差缩减变体,并证明在 11-Wasserstein 距离情况下,两者均能达到 O~(ε2μπ,min1(1γ)3+tmixμπ,min1(1γ)1)\tilde{O}(\varepsilon^{-2} \mu_{\pi,\min}^{-1}(1-\gamma)^{-3}+t_{mix}\mu_{\pi,\min}^{-1}(1-\gamma)^{-1}) 的样本复杂度上界,这与经典策略评估的 state-of-the-art 统计结果相匹配。为了实现这一精确的统计速率,我们在 Hilbert 空间中建立了一个新的 Freedman 不等式。这一新的 Freedman 不等式对于各种无穷维在线学习问题的统计分析将具有独立的意义。

关键词

引用

@article{arxiv.2403.05811,
  title  = {Statistical Efficiency of Distributional Temporal Difference Learning and Freedman's Inequality in Hilbert Spaces},
  author = {Yang Peng and Liangyu Zhang and Zhihua Zhang},
  journal= {arXiv preprint arXiv:2403.05811},
  year   = {2025}
}