中文

ANO:稳健策略优化的原则方法

人工智能 2026-05-07 v2 机器学习

摘要

近端策略优化 (PPO) 在强化学习和 LLM 对齐领域占据主导地位,但依赖一种硬性剪裁机制,舍弃了有价值的梯度。相反,无约束方法如 SPO 使优化暴露于不可限制的更新,在遇到极端离群值时导致严重不稳定和策略崩溃。为解决这一困境,我们引入了策略优化的原则性设计空间,证明了稳健估计器必须本质上抑制离群值同时保持光滑的恢复力。基于这些几何原则,我们推导出锚定邻域优化 (ANO),一种新型方法,无缝地用红escending 梯度机制取代硬性剪裁。广泛的评估表明,ANO 在 diverse 领域中实现了 empirical 支配。 在连续 (MuJoCo) 和离散 (Atari) 控制任务中,ANO 建立了稳健的 state-of-the-art,独特地即使在高度激进的学习率 (1×1031 \times 10^{-3}) 下也能防止策略崩溃。此外,在 LLM 对齐 (RLHF) 中,ANO 明确消除 unconstrained 方法中固有的灾难性 KL 散度爆炸,在与 PPO、SPO 和 GRPO 的 head-to-head 比较中占据优势。

关键词

引用

@article{arxiv.2605.02320,
  title  = {ANO: A Principled Approach to Robust Policy Optimization},
  author = {Yiheng Zhang and Yiming Wang and Kaiyan Zhao and Zhenglin Wan and Jiayu Chen and Leong Hou U},
  journal= {arXiv preprint arXiv:2605.02320},
  year   = {2026}
}