中文

再生核 Hilbert 空间中的策略 Newton 算法

机器学习 2025-06-03 v1 人工智能

摘要

在再生核 Hilbert 空间 (RKHS) 中表示的强化学习 (RL) 策略提供了强大的表示能力。虽然诸如 Newton 法等二阶优化方法比一阶方法展现出更快的收敛速度,但当前基于 RKHS 的策略优化仍局限于一阶技术。这一限制主要源于在 RKHS 中显式计算和求逆无限维 Hessian 算子的不可处理性。我们提出了 RKHS 中的 Policy Newton,这是首个专为在 RKHS 中表示的 RL 策略设计的二阶优化框架。我们的方法通过优化一个三次正则化辅助目标函数,规避了 Hessian 算子求逆的直接计算。关键在于,我们利用表示定理将这一无限维优化转化为一个等价的、计算上易于处理的有限维问题,其维度随轨迹数据量扩展。我们建立了理论保证,证明其能以局部二次收敛速率收敛至局部最优。在一个简单的金融资产配置问题上的实证评估验证了这些理论性质,而在标准 RL 基准上的实验表明,与现有的一阶 RKHS 方法和参数化二阶方法相比,RKHS 中的 Policy Newton 实现了更快的收敛速度和更高的回合奖励。我们的工作弥合了强化学习中非参数策略表示与二阶优化方法之间的关键空白。

关键词

引用

@article{arxiv.2506.01597,
  title  = {Policy Newton Algorithm in Reproducing Kernel Hilbert Space},
  author = {Yixian Zhang and Huaze Tang and Chao Wang and Wenbo Ding},
  journal= {arXiv preprint arXiv:2506.01597},
  year   = {2025}
}