超越表格情形下的单调保守策略迭代
机器学习
2026-04-03 v3 人工智能
最优化与控制
摘要
我们引入可靠策略迭代 (RPI) 和保守RPI (CRPI),作为策略迭代 (PI) 和保守PI (CPI) 的变体,在函数逼近下保持表格保证。RPI 使用一种新颖的 Bellman 约束优化进行策略评估。我们证明RPI恢复了价值估计的文本学单调性,并且这些估计可证明地下界于真实收益;此外,它们的极限部分满足未投影Bellman方程。CRPI 共享RPI的评估,但以保守方式更新策略,通过最大化一种新型的绩效差异下界来实现,这种下界显式地考虑了函数逼近引起的误差。CRPI 继承了RPI的保证,关键的是,它允许逐步改进的界限。在初始模拟中,RPI和CRPI超越了PI及其变体。我们的工作解决了强化学习中的一个基础性缺口:流行算法如TRPO和PPO源自表格CPI,但在函数逼近下部署,其中CPI的保证常常失败——导致发散、振荡或收敛到次优策略。通过恢复PI/CPI风格的保证,RPI和CRPI为下一代强化学习提供了原则化的基础。
引用
@article{arxiv.2506.07134,
title = {Monotone and Conservative Policy Iteration Beyond the Tabular Case},
author = {S. R. Eshwar and Gugan Thoppe and Ananyabrata Barua and Aditya Gopalan and Gal Dalal},
journal= {arXiv preprint arXiv:2506.07134},
year = {2026}
}