$f$-散度正则化的 RLHF:采样二重奏与统一分析
机器学习
2026-05-11 v1 人工智能
信息论
math.IT
机器学习
摘要
Reinforcement Learning from Human Feedback (RLHF) 已成为大型语言模型后训练的基石技术。虽然大多数现有方法依赖于逆向 KL 正则化,但近期的实证研究已开始探索在 RLHF 中使用替代散度(例如,正向 KL、卡方)作为正则化项。然而,对一般 -散度正则化的统一理论理解仍探索不足。为了填补这一空白,本研究为具有一般 -散度正则化目标的在线 RLHF 开发了一个全面的理论框架。我们没有单独处理每个可能的散度函数,而是采用跨整个函数类的全局视角,并基于不同的采样原理提出了两种算法。第一种算法通过精心设计的探索奖励扩展了经典的乐观主义原则,而第二种算法引入了一种新方法,利用了最优策略对 -散度正则化下奖励扰动的敏感性。理论分析表明, 的遗憾和 的次优性差距是可实现的,确立了两种算法的可证明效率,并据我们所知,首次为一般 -散度正则化下的在线 RLHF 提供了性能界。
引用
@article{arxiv.2605.06977,
title = {$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses},
author = {Di Wu and Chengshuai Shi and Jing Yang and Cong Shen},
journal= {arXiv preprint arXiv:2605.06977},
year = {2026}
}
备注
ICML 2026