分布式时序差分学习的统计效率与 Hilbert 空间中的 Freedman 不等式
机器学习
2025-01-17 v4 机器学习
摘要
分布式强化学习(DRL)在多个领域取得了经验上的成功。DRL 中的一个核心任务是分布式策略评估,即估计给定策略 的回报分布 。相应地,分布式时序差分学习被提出,它扩展了强化学习中经典的时序差分学习(TD)。本文关注分布式 TD 的非渐近统计速率。为了便于理论分析,我们提出了非参数分布式 TD(NTD)。对于 -折扣无限水平表格 Markov 决策过程,我们证明对于带有生成模型的 NTD,当估计误差由 -Wasserstein 距离衡量时,我们需要 次与环境交互才能以高概率获得 -最优估计量。该样本复杂度上界在相差对数因子意义下是极小化极大的。此外,我们重新审视了类别分布式 TD(CTD),证明在 -Wasserstein 距离情况下,相同的非渐近收敛上界对 CTD 也成立。我们还将分析扩展到数据生成过程为 Markov 过程的更一般设定。在 Markov 设定下,我们提出了 NTD 和 CTD 的方差缩减变体,并证明在 -Wasserstein 距离情况下,两者均能达到 的样本复杂度上界,这与经典策略评估的 state-of-the-art 统计结果相匹配。为了实现这一精确的统计速率,我们在 Hilbert 空间中建立了一个新的 Freedman 不等式。这一新的 Freedman 不等式对于各种无穷维在线学习问题的统计分析将具有独立的意义。
引用
@article{arxiv.2403.05811,
title = {Statistical Efficiency of Distributional Temporal Difference Learning and Freedman's Inequality in Hilbert Spaces},
author = {Yang Peng and Liangyu Zhang and Zhihua Zhang},
journal= {arXiv preprint arXiv:2403.05811},
year = {2025}
}