Fisher-Rao 几何下的 PPO
机器学习
2026-02-02 v2 最优化与控制
摘要
准近似政策优化 (PPO) 因其强大的经验性能而广泛应用于强化学习,但缺乏关于政策改进和收敛的正式保证。PPO 的裁剪单价函数目标是受平坦几何设置下价值函数线性化下界的启发。我们推导了更紧致的单价函数目标,通过利用 Fisher-Rao (FR) 几何引入 Fisher-Rao PPO (FR-PPO)。我们的方案提供了强大的理论保证,包括单调政策改进。在直接参数化设置下,我们证明 FR-PPO 在无状态或动作空间维度依赖条件下实现亚线性收敛;对于参数化政策则进一步获得亚线性收敛,直至兼容函数逼近误差。尽管我们的主要关注理论,我们也在一系列标准强化学习任务上证明了 FR-PPO 的实际表现良好。
引用
@article{arxiv.2506.03757,
title = {PPO in the Fisher-Rao geometry},
author = {Razvan-Andrei Lascu and David Šiška and Łukasz Szpruch},
journal= {arXiv preprint arXiv:2506.03757},
year = {2026}
}
备注
34 pages; Added section on Natural Policy Gradient. Added numerical experiments