ISOPO: 无需 pi-old 的近端策略梯度
机器学习
2026-01-01 v2
摘要
本文介绍 Isometric Policy Optimization (ISOPO),一种高效逼近自然策略梯度的方法,可在单次梯度步骤中实现。与现有近端策略方法如 GRPO 或 CISPO 不同,ISOPO 使用重要性比率裁剪的变体在单次梯度步骤中逼近自然梯度步骤。其最简单形式下,ISOPO 对每个序列的对数概率梯度在 Fisher 度量下进行归一化,然后与优势值相约束。ISOPO 的另一种变体基于每层的神经切向核 (NTK) 转换微批次优势值。ISOPO 在单次反向传播中按层应用此转换,可与基础 REINFORCE 计算开销几乎相同。
引用
@article{arxiv.2512.23353,
title = {ISOPO: Proximal policy gradients without pi-old},
author = {Nilin Abrahamsen},
journal= {arXiv preprint arXiv:2512.23353},
year = {2026}
}