中文

RKHS 中 TD 与 PPO 的采样复杂度

机器学习 2025-09-30 v1

摘要

我们从函数空间视角重新审视近端策略优化(PPO)。我们的分析在再生核希尔伯特空间(RKHS)中解耦了策略评估与策略改进: 核化时序差分(TD)评价器仅使用单步状态-动作转移样本执行高效的 RKHS 梯度更新; 基于 KL 正则化的自然梯度策略步对评估的动作价值进行指数化,在连续状态-动作空间中恢复出 PPO/TRPO 式的近端更新。我们提供了非渐近的、实例自适应的保证,其速率取决于 RKHS 熵,统一了表格型、线性、Sobolev、高斯和神经正切核(NTK)情形;并推导了近端更新的采样规则,确保随机优化达到最优的 k1/2k^{-1/2} 收敛速率。在实验中,与理论对齐的调度在常见控制任务(如 CartPole、Acrobot)上提升了稳定性和样本效率,同时我们基于 TD 的评价器相较于 GAE 基线取得了良好的吞吐量。总而言之,我们的结果将 PPO 置于超越有限维假设的更坚实理论基础之上,并阐明了带有核 TD 评价器的 RKHS 近端更新何时能以实用效率实现全局策略改进。

关键词

引用

@article{arxiv.2509.24991,
  title  = {Sampling Complexity of TD and PPO in RKHS},
  author = {Lu Zou and Wendi Ren and Weizhong Zhang and Liang Ding and Shuang Li},
  journal= {arXiv preprint arXiv:2509.24991},
  year   = {2025}
}