统一稳定优化与参考正则化在 RLHF 中的方法
机器学习
2026-02-13 v1
摘要
强化学习从人类反馈(RLHF)已取得显著进展,但仍受两个核心挑战的制约:reward hacking(奖励作弊)和 stable optimization(稳定优化)。当前解决方案通过独立的正则化策略分别解决这两个问题:具体做法是对监督微调模型(π0)施加 KL 散度惩罚以缓解奖励作弊,以及对当前策略(πt)施加策略比例剪裁以促进稳定对齐。然而,同时针对 π0 和 πt 进行正则化所产生的隐式权衡尚未得到充分探索。本文提出一种统一的正则化方法,显式平衡防止奖励作弊和维持稳定策略更新的目标。我们的方法简洁而原则,产生一种加权监督微调损失,实现更优的权衡,显著改善了对齐结果和实现复杂度。广泛的实验在多个基准上验证了我们的方法在对齐性能和稳定性方面 consistently 优于 RLHF 和在线偏好学习方法,实现了增强的对齐性能和稳定性。
引用
@article{arxiv.2602.11523,
title = {Unifying Stable Optimization and Reference Regularization in RLHF},
author = {Li He and Qiang Qu and He Zhao and Stephen Wan and Dadong Wang and Lina Yao and Tongliang Liu},
journal= {arXiv preprint arXiv:2602.11523},
year = {2026}
}
备注
ICLR 2026