SAFE:基于熵感知预测控制的稳定对齐微调方法,用于强化学习从人类反馈
机器学习
2026-02-10 v2
摘要
最近的文献将PPO(Proximal Policy Optimization)置于强化学习从人类反馈(RLHF)中强化学习部分的标准方法中。PPO在实证上表现良好,但其动机较为经验性,以一种非正式的方式处理LM-RLHF中使用的KL散度约束,并且存在奖励波动、熵坍缩、价值函数漂移以及突发性策略发散问题,这些问题需要频繁重启和大量调参。本文开发了一种新的纯基于策略的演员-评论家RL方法,用于LM-RLHF设置。我们提出了SAFE(Stable Alignment Finetuning with Entropy-aware control),一种新的RLHF算法,将双软最小值评论家用于保守价值估计,以及一种新的多层稳定框架,结合熵门控KL调节和PID控制自适应阈值。与标准PPO的对称KL惩罚不同,SAFE区分了高熵探索与低熵模式坍缩,并根据奖励速度动态调整惩罚。在3B参数模型上的实验表明,SAFE的训练平均奖励比PPO高出+5.15%(0.725 vs 0.689),几乎没有奖励崩溃,KL控制优于PPO。该方法增加的计算开销最小,提供了一个可解释且抗崩溃的RLHF框架,在保持激进学习速度的同时,确保适用于生产部署的稳定长期优化。代码已公开:https://github.com/ryyzn9/SAFE
引用
@article{arxiv.2602.04651,
title = {SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF)},
author = {Dipan Maity},
journal= {arXiv preprint arXiv:2602.04651},
year = {2026}
}