中文

基于策略 Hessian 分解的折扣 MDP 的二阶 Actor-Critic 方法

机器学习 2026-05-15 v1 人工智能

摘要

我们聚焦于强化学习 (RL) 中的折扣奖励设置。为缓解策略梯度方法中值近似的挑战,已发展出 actor-critic 方法,并已知在适当假设下收敛于 stationary points。然而,这些方法依赖一阶更新。相比之下,二阶优化提供了原则性的曲率感知更新,已证明可加速收敛,但其在 RL 中的应用受限于 Hessian 估计的计算复杂度。在本工作中,我们分析针对 actor 更新的二阶近似,充分利用目标函数的完整曲率信息。稳定的近似需要将动作价函数视为相对于策略参数在局部保持不变,这在策略梯度方法中通常不成立。我们指出,在两时间尺度的 actor-critic 框架下,该近似变得合理化:批评家在更快的时间尺度上演化,能够在 actor 更新期间被视为准平稳状态。基于这一洞察,我们构建了一个针对折扣奖励设置的二阶 actor-critic 方法,利用 Hessian 向量积 (HVP) 计算,实现计算高效且稳定的二阶更新。

关键词

引用

@article{arxiv.2605.14982,
  title  = {Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition},
  author = {Sanjeev Manivannan and Shuban V},
  journal= {arXiv preprint arXiv:2605.14982},
  year   = {2026}
}

备注

9 pages, 2 figures including Appendix with Detailed proofs