自然策略梯度的双平滑策略迭代:基于 Bellman 算子的框架
机器学习
2026-05-12 v1 最优化与控制
机器学习
摘要
本文展示了自然策略梯度——强化学习中的核心算法——恰好可以表述为策略迭代的平滑化和平均化形式。具体而言,我们引入双平滑策略迭代 (DSPI),这是一种基于 Bellman 算子的框架,其中每一步策略都是通过对过去 函数的加权平均执行正则化贪心步骤获得。DSPI 包含策略迭代、双平均策略迭代、自然策略梯度以及更一般的策略双平均方法等特例。仅使用平滑 Bellman 算子的单调性和收敛性,我们证明了 DSPI 在分布无关的全局几何收敛。因此,标准自然策略梯度和策略双平均方法在计算 最优策略时,迭代复杂度为 ,无需修改 MDP、无需添加超出镜像映射本身的正则化,也无需使用自适应、轨迹依赖的步长。对于未正则化的贪心情况,即对应双平均策略迭代,我们也证明了有限终止。相同的 Bellman 算子框架进一步扩展到线性函数逼近和随机最短路径问题的折扣 MDP 中。
关键词
引用
@article{arxiv.2605.10671,
title = {Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework},
author = {Phalguni Nanda and Zaiwei Chen},
journal= {arXiv preprint arXiv:2605.10671},
year = {2026}
}