基于 Nyström 超梯度的双层策略优化
机器学习
2026-03-19 v2 人工智能
计算机科学与博弈论
摘要
在 Actor-Critic(AC)强化学习中,Actor 对 Critic 的依赖意味着 AC 可以被描述为一个双层优化(BLO)问题,也称为 Stackelberg 博弈。这种描述促使对标准 AC 算法进行两项修改。首先,Critic 的更新应嵌套进行,以学习对 Actor 策略的最佳响应。其次,Actor 应根据考虑了 Critic 行为变化的超梯度进行更新。计算此超梯度涉及求逆 Hessian 向量积,这一过程在数值上可能不稳定。因此,我们提出了一种新算法——基于 Nyström 超梯度的双层策略优化(BLPO),该算法利用嵌套来考虑 BLO 的嵌套结构,并利用 Nyström 方法计算超梯度。理论上,我们证明了在 Critic 目标线性参数化的假设下,BLPO 能在多项式时间内以高概率收敛到局部强 Stackelberg 均衡(满足必要条件的一个点)。实验上,我们证明 BLPO 在多种离散和连续控制任务上的性能与 PPO 相当或更优。
引用
@article{arxiv.2505.11714,
title = {Bi-Level Policy Optimization with Nystr\"om Hypergradients},
author = {Arjun Prakash and Naicheng He and Denizalp Goktas and Jacob Makar-Limanov and Amy Greenwald},
journal= {arXiv preprint arXiv:2505.11714},
year = {2026}
}