中文

$f$-散度正则化的 RLHF:采样二重奏与统一分析

机器学习 2026-05-11 v1 人工智能 信息论 math.IT 机器学习

摘要

Reinforcement Learning from Human Feedback (RLHF) 已成为大型语言模型后训练的基石技术。虽然大多数现有方法依赖于逆向 KL 正则化,但近期的实证研究已开始探索在 RLHF 中使用替代散度(例如,正向 KL、卡方)作为正则化项。然而,对一般 ff-散度正则化的统一理论理解仍探索不足。为了填补这一空白,本研究为具有一般 ff-散度正则化目标的在线 RLHF 开发了一个全面的理论框架。我们没有单独处理每个可能的散度函数,而是采用跨整个函数类的全局视角,并基于不同的采样原理提出了两种算法。第一种算法通过精心设计的探索奖励扩展了经典的乐观主义原则,而第二种算法引入了一种新方法,利用了最优策略对 ff-散度正则化下奖励扰动的敏感性。理论分析表明,O(logT)O(\log T) 的遗憾和 O(1/T)O(1/T) 的次优性差距是可实现的,确立了两种算法的可证明效率,并据我们所知,首次为一般 ff-散度正则化下的在线 RLHF 提供了性能界。

关键词

引用

@article{arxiv.2605.06977,
  title  = {$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses},
  author = {Di Wu and Chengshuai Shi and Jing Yang and Cong Shen},
  journal= {arXiv preprint arXiv:2605.06977},
  year   = {2026}
}

备注

ICML 2026